如何10分钟上手TokenSpeed?LLM推理引擎最简快速入门教程
【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeed
TokenSpeed是一款面向智能体(Agentic)工作负载的“光速”LLM 推理引擎,主打 TensorRT-LLM 级别的性能与 vLLM 级别的使用体验。无论你是想快速部署一个大模型服务,还是评估推理引擎选型,跟着这篇 TokenSpeed 快速入门教程,10 分钟就能跑通「安装 → 验证 → 起服务 → 调 API」全流程。
TokenSpeed 是什么?🚀
TokenSpeed 由非营利组织 LightSeek Foundation 主导开发,是 PyTorch 生态系统的一员,并得到 NVIDIA、AMD 等硬件厂商的工程支持。它的核心差异点可以概括为三块:
| 核心组件 | 说明 |
|---|---|
| 调度器(Scheduler) | C++ 控制面 + Python 执行面分离,请求生命周期与 KV 缓存管理被建模为有限状态机,资源安全由类型系统在编译期保证 |
| 内核(Kernels) | 可插拔的分层内核系统,提供统一公开 API 与集中式注册表,内含 Blackwell 上最快的 MLA(多头潜在注意力)实现之一 |
| 入口(Entrypoint) | 集成 SMG 的 AsyncLLM 服务,CPU 侧请求处理开销极低,对外暴露OpenAI 兼容 API |
对新手来说最关键的一点是:TokenSpeed 沿用了业界熟悉的参数命名(如--tensor-parallel-size、--kv-cache-dtype),几乎零学习成本。
环境准备:两种方式任选其一
方式一:Docker 运行容器(推荐新手)
拉取官方运行镜像并启动容器(需要 NVIDIA GPU + 支持 GPU 的 Docker):
docker pull lightseekorg/tokenspeed-runner:latest docker run -itd \ --shm-size 32g \ --gpus all \ -v /raid/cache:/home/runner/.cache \ --ipc=host --network=host --pid=host \ --privileged \ --name tokenspeed \ lightseekorg/tokenspeed-runner:latest \ /bin/bash进入容器后克隆源码:
git clone https://gitcode.com/gh_mirrors/to/tokenspeed cd tokenspeed方式二:本地 Python 环境安装
在 Python 3.10–3.13 环境中,从源码依次安装三个包即可(细节见 docs/guides/getting-started.md):
# 1. Python 运行时 export PIP_BREAK_SYSTEM_PACKAGES=1 pip install -e "./python" --no-build-isolation # 2. 内核包(会自动安装所选后端的依赖) pip install -e tokenspeed-kernel/python/ --no-build-isolation # 3. 调度器包(C++ 控制面) pip install -e tokenspeed-scheduler/💡 H100/H200 + CUDA 12.9 的用户可以参考 Hopper / CUDA 12.9 源码安装指南,一条命令完成环境搭建。
一分钟验证 + 拉起第一个 LLM 服务
第 1 步:验证环境
tokenspeed env # 检查环境配置与依赖版本 tokenspeed serve --helptokenspeed env会打印关键依赖版本,是排查安装问题最快的命令。
第 2 步:最小化启动命令
TokenSpeed 的服务启动只需一行命令,把模型路径直接写在serve后面即可:
tokenspeed serve openai/gpt-oss-20b \ --host 0.0.0.0 \ --port 8000 \ --tensor-parallel-size 1启动完成后,服务会在http://0.0.0.0:8000/v1暴露OpenAI 兼容 API,无需任何额外网关配置。
第 3 步:发起第一次对话请求
用 Python 的 OpenAI SDK 直接接入(现有 OpenAI 客户端代码可以无缝迁移):
from openai import OpenAI client = OpenAI(api_key="EMPTY", base_url="http://localhost:8000/v1") response = client.chat.completions.create( model="gpt-oss-20b", messages=[{"role": "user", "content": "一句话介绍一下 TokenSpeed"}], max_tokens=256, ) print(response.choices[0].message.content)到这里,一个可用的 LLM 推理服务已经跑起来了 🎉
进阶调优:生产级 LLM 推理的关键参数
想从"能跑"到"跑得快",只需关注几个高频参数(完整参考见 docs/configuration/server.md):
| 参数 | 作用 |
|---|---|
--tensor-parallel-size/--data-parallel-size | 张量/数据并行度,匹配硬件拓扑(详见 并行策略文档) |
--enable-expert-parallel | MoE 专家并行,大模型部署常用 |
--kv-cache-dtype fp8 | FP8 KV 缓存,显著降低显存占用 |
--max-model-len | 最大上下文长度 |
--attention-backend | 注意力后端,如 Blackwell 上的trtllm_mla |
--moe-backend | MoE 计算后端,如flashinfer_trtllm |
--speculative-algorithm | 投机解码(MTP / EAGLE3 / DSpark 等),大幅提升解码吞吐 |
以 Kimi K2.5 的生产部署为例(完整命令见 docs/guides/launching.md):
tokenspeed serve nvidia/Kimi-K2.5-NVFP4 \ --served-model-name kimi-k2.5 \ --max-model-len 262144 \ --kv-cache-dtype fp8 \ --quantization nvfp4 \ --tensor-parallel-size 4 \ --enable-expert-parallel \ --attention-backend trtllm_mla \ --moe-backend flashinfer_trtllm \ --host 0.0.0.0 --port 8000官方基准测试显示,在 B200 上运行 Kimi K2.5 智能体工作负载时,TokenSpeed 的吞吐-延迟帕累托曲线全面优于 TensorRT-LLM:
为什么 TokenSpeed 这么快?🔍
性能的秘密藏在两个子系统里:
- 控制面/执行面分离架构——首个将 C++ 有限状态机作为控制面的开源 LLM 推理引擎,KV 资源复用、请求生命周期等正确性保证在编译期完成,而不是运行时打补丁;Python 执行面则保证了快速迭代。
- 内核作为一等公民——内核系统与核心引擎解耦,通过集中注册表 + 插件机制支持异构加速卡。其 MLA 内核在 prefill 阶段相比基线有显著延迟优势:
在 AMD GPU 上,专用内核同样覆盖了注意力与 MoE 两大热点路径:
常见模型食谱与下一步 📚
仓库内置了大量经过验证的部署配方,覆盖 Kimi K2.5/K3、DeepSeek V4、GLM5、Qwen3.8、GPT-OSS、MiniMax M3 等模型家族,直接对号入座即可:
- 📘 模型部署食谱 —— 按模型家族查找启动命令模板
- 📘 服务参数参考 —— 模型加载、量化、投机解码等参数详解
- 📘 入门指南 —— 环境搭建与验证的完整流程
- 📘 启动服务指南 —— 最小启动与生产级启动骨架
- 📘 并行策略 —— 多卡/多机拓扑选择
- 📘 CLI 入口源码 ——
serve/env/version子命令实现
上手小结
| 阶段 | 耗时 | 关键命令 |
|---|---|---|
| 安装 | ~5 分钟 | pip install -e ./python等三条命令 |
| 验证 | ~1 分钟 | tokenspeed env |
| 起服务 | ~3 分钟 | tokenspeed serve <模型> --port 8000 |
| 调 API | 即时 | OpenAI 兼容 SDK 直接接入 |
TokenSpeed 用「熟悉的参数 + 强大的默认值」把 LLM 推理引擎的上手门槛压到了最低。现在就挑一个你熟悉的模型,把tokenspeed serve跑起来吧!
【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeed
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考