光速级 LLM 推理引擎,基于 Python 构建
实现每秒数千 token 的极致生成速度
创新的分页注意力机制,将 KV Cache 分块管理,显存利用率提升 2-4 倍
动态请求调度,新请求无需等待当前批次完成,吞吐量提升 5-10 倍
原生支持 Hopper 架构 FP8,精度损失 <0.5%,速度提升 2 倍
纯 Python 实现,易于扩展和定制,无缝集成现有 AI 生态
# 安装 TokenSpeed
pip install tokenspeed
# 或使用源码安装
git clone https://github.com/tokenspeed/tokenspeed.git
cd tokenspeed
pip install -e .
from tokenspeed import LLMEngine
# 初始化引擎
engine = LLMEngine(
model="meta-llama/Llama-2-70b",
quantization="fp8",
tensor_parallel=4
)
# 启动服务
engine.serve(host="0.0.0.0", port=8000)
import requests
# 发送推理请求
response = requests.post("http://localhost:8000/generate", json={
"prompt": "解释量子计算的基本原理:",
"max_tokens": 2048,
"temperature": 0.7
})
result = response.json()
print(f"生成速度: {result['tokens_per_second']:.1f} tokens/s")
print(f"首token延迟: {result['first_token_latency']:.2f}ms")
print(f"总token数: {result['total_tokens']}")
| 特性 | TokenSpeed | vLLM | TensorRT-LLM |
|---|---|---|---|
| 编程语言 | Python | Python/C++ | C++ |
| PagedAttention | ✓ 原生支持 | ✓ | ✗ |
| 连续批处理 | ✓ 动态调度 | ✓ | ✓ |
| FP8 量化 | ✓ 硬件加速 | 部分支持 | ✓ |
| 模型并行 | TP + PP | TP | TP + PP |
| LoRA 适配 | ✓ 热加载 | ✓ | ✗ |
| 开源协议 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
与全球开发者一起构建下一代 LLM 推理基础设施,探索性能的极限边界。