返回演示中心
Python 高性能推理引擎

TokenSpeed

光速级 LLM 推理引擎,基于 Python 构建
实现每秒数千 token 的极致生成速度

0
tokens/秒
FP8
量化精度
70B
模型支持

实时推理演示

模型配置

实时速度

0
tokens/s
0
总 token
0ms
首 token 延迟
output.txt
就绪
# 点击"开始推理"查看 TokenSpeed 的极速生成能力...
|
吞吐量
0%
内存使用
0%

性能基准测试

vs vLLM +2.3x
3,847
tokens/s 峰值
vs TensorRT-LLM +1.8x
2,156
tokens/s 平均
vs 原生 PyTorch +5.6x
12.4ms
首 token 延迟

核心架构

PagedAttention

创新的分页注意力机制,将 KV Cache 分块管理,显存利用率提升 2-4 倍

连续批处理

动态请求调度,新请求无需等待当前批次完成,吞吐量提升 5-10 倍

FP8 量化

原生支持 Hopper 架构 FP8,精度损失 <0.5%,速度提升 2 倍

Python 原生

纯 Python 实现,易于扩展和定制,无缝集成现有 AI 生态

快速开始

install.sh
# 安装 TokenSpeed
pip install tokenspeed

# 或使用源码安装
git clone https://github.com/tokenspeed/tokenspeed.git
cd tokenspeed
pip install -e .
serve.py
from tokenspeed import LLMEngine

# 初始化引擎
engine = LLMEngine(
    model="meta-llama/Llama-2-70b",
    quantization="fp8",
    tensor_parallel=4
)

# 启动服务
engine.serve(host="0.0.0.0", port=8000)
benchmark.py
import requests

# 发送推理请求
response = requests.post("http://localhost:8000/generate", json={
    "prompt": "解释量子计算的基本原理:",
    "max_tokens": 2048,
    "temperature": 0.7
})

result = response.json()
print(f"生成速度: {result['tokens_per_second']:.1f} tokens/s")
print(f"首token延迟: {result['first_token_latency']:.2f}ms")
print(f"总token数: {result['total_tokens']}")

技术规格

特性 TokenSpeed vLLM TensorRT-LLM
编程语言 Python Python/C++ C++
PagedAttention ✓ 原生支持 ✓ ✗
连续批处理 ✓ 动态调度 ✓ ✓
FP8 量化 ✓ 硬件加速 部分支持 ✓
模型并行 TP + PP TP TP + PP
LoRA 适配 ✓ 热加载 ✓ ✗
开源协议 Apache 2.0 Apache 2.0 Apache 2.0

加入 TokenSpeed 社区

与全球开发者一起构建下一代 LLM 推理基础设施,探索性能的极限边界。

12.5k+ Stars
200+ 贡献者
50+ 企业采用