☰
如何10分钟上手TokenSpeed?LLM推理引擎最简快速入门教程
2026/10/7 8:10:59 网站建设 项目流程

如何10分钟上手TokenSpeed?LLM推理引擎最简快速入门教程

【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeed

TokenSpeed是一款面向智能体(Agentic)工作负载的“光速”LLM 推理引擎,主打 TensorRT-LLM 级别的性能与 vLLM 级别的使用体验。无论你是想快速部署一个大模型服务,还是评估推理引擎选型,跟着这篇 TokenSpeed 快速入门教程,10 分钟就能跑通「安装 → 验证 → 起服务 → 调 API」全流程。

TokenSpeed 是什么?🚀

TokenSpeed 由非营利组织 LightSeek Foundation 主导开发,是 PyTorch 生态系统的一员,并得到 NVIDIA、AMD 等硬件厂商的工程支持。它的核心差异点可以概括为三块:

核心组件说明
调度器(Scheduler)C++ 控制面 + Python 执行面分离,请求生命周期与 KV 缓存管理被建模为有限状态机,资源安全由类型系统在编译期保证
内核(Kernels)可插拔的分层内核系统,提供统一公开 API 与集中式注册表,内含 Blackwell 上最快的 MLA(多头潜在注意力)实现之一
入口(Entrypoint)集成 SMG 的 AsyncLLM 服务,CPU 侧请求处理开销极低,对外暴露OpenAI 兼容 API

对新手来说最关键的一点是:TokenSpeed 沿用了业界熟悉的参数命名(如--tensor-parallel-size、--kv-cache-dtype),几乎零学习成本。

环境准备:两种方式任选其一

方式一:Docker 运行容器(推荐新手)

拉取官方运行镜像并启动容器(需要 NVIDIA GPU + 支持 GPU 的 Docker):

docker pull lightseekorg/tokenspeed-runner:latest docker run -itd \ --shm-size 32g \ --gpus all \ -v /raid/cache:/home/runner/.cache \ --ipc=host --network=host --pid=host \ --privileged \ --name tokenspeed \ lightseekorg/tokenspeed-runner:latest \ /bin/bash

进入容器后克隆源码:

git clone https://gitcode.com/gh_mirrors/to/tokenspeed cd tokenspeed

方式二:本地 Python 环境安装

在 Python 3.10–3.13 环境中,从源码依次安装三个包即可(细节见 docs/guides/getting-started.md):

# 1. Python 运行时 export PIP_BREAK_SYSTEM_PACKAGES=1 pip install -e "./python" --no-build-isolation # 2. 内核包(会自动安装所选后端的依赖) pip install -e tokenspeed-kernel/python/ --no-build-isolation # 3. 调度器包(C++ 控制面) pip install -e tokenspeed-scheduler/

💡 H100/H200 + CUDA 12.9 的用户可以参考 Hopper / CUDA 12.9 源码安装指南,一条命令完成环境搭建。

一分钟验证 + 拉起第一个 LLM 服务

第 1 步:验证环境

tokenspeed env # 检查环境配置与依赖版本 tokenspeed serve --help

tokenspeed env会打印关键依赖版本,是排查安装问题最快的命令。

第 2 步:最小化启动命令

TokenSpeed 的服务启动只需一行命令,把模型路径直接写在serve后面即可:

tokenspeed serve openai/gpt-oss-20b \ --host 0.0.0.0 \ --port 8000 \ --tensor-parallel-size 1

启动完成后,服务会在http://0.0.0.0:8000/v1暴露OpenAI 兼容 API,无需任何额外网关配置。

第 3 步:发起第一次对话请求

用 Python 的 OpenAI SDK 直接接入(现有 OpenAI 客户端代码可以无缝迁移):

from openai import OpenAI client = OpenAI(api_key="EMPTY", base_url="http://localhost:8000/v1") response = client.chat.completions.create( model="gpt-oss-20b", messages=[{"role": "user", "content": "一句话介绍一下 TokenSpeed"}], max_tokens=256, ) print(response.choices[0].message.content)

到这里,一个可用的 LLM 推理服务已经跑起来了 🎉

进阶调优:生产级 LLM 推理的关键参数

想从"能跑"到"跑得快",只需关注几个高频参数(完整参考见 docs/configuration/server.md):

参数作用
--tensor-parallel-size/--data-parallel-size张量/数据并行度,匹配硬件拓扑(详见 并行策略文档)
--enable-expert-parallelMoE 专家并行,大模型部署常用
--kv-cache-dtype fp8FP8 KV 缓存,显著降低显存占用
--max-model-len最大上下文长度
--attention-backend注意力后端,如 Blackwell 上的trtllm_mla
--moe-backendMoE 计算后端,如flashinfer_trtllm
--speculative-algorithm投机解码(MTP / EAGLE3 / DSpark 等),大幅提升解码吞吐

以 Kimi K2.5 的生产部署为例(完整命令见 docs/guides/launching.md):

tokenspeed serve nvidia/Kimi-K2.5-NVFP4 \ --served-model-name kimi-k2.5 \ --max-model-len 262144 \ --kv-cache-dtype fp8 \ --quantization nvfp4 \ --tensor-parallel-size 4 \ --enable-expert-parallel \ --attention-backend trtllm_mla \ --moe-backend flashinfer_trtllm \ --host 0.0.0.0 --port 8000

官方基准测试显示,在 B200 上运行 Kimi K2.5 智能体工作负载时,TokenSpeed 的吞吐-延迟帕累托曲线全面优于 TensorRT-LLM:

为什么 TokenSpeed 这么快?🔍

性能的秘密藏在两个子系统里:

  1. 控制面/执行面分离架构——首个将 C++ 有限状态机作为控制面的开源 LLM 推理引擎,KV 资源复用、请求生命周期等正确性保证在编译期完成,而不是运行时打补丁;Python 执行面则保证了快速迭代。
  2. 内核作为一等公民——内核系统与核心引擎解耦,通过集中注册表 + 插件机制支持异构加速卡。其 MLA 内核在 prefill 阶段相比基线有显著延迟优势:

在 AMD GPU 上,专用内核同样覆盖了注意力与 MoE 两大热点路径:

常见模型食谱与下一步 📚

仓库内置了大量经过验证的部署配方,覆盖 Kimi K2.5/K3、DeepSeek V4、GLM5、Qwen3.8、GPT-OSS、MiniMax M3 等模型家族,直接对号入座即可:

  • 📘 模型部署食谱 —— 按模型家族查找启动命令模板
  • 📘 服务参数参考 —— 模型加载、量化、投机解码等参数详解
  • 📘 入门指南 —— 环境搭建与验证的完整流程
  • 📘 启动服务指南 —— 最小启动与生产级启动骨架
  • 📘 并行策略 —— 多卡/多机拓扑选择
  • 📘 CLI 入口源码 ——serve/env/version子命令实现

上手小结

阶段耗时关键命令
安装~5 分钟pip install -e ./python等三条命令
验证~1 分钟tokenspeed env
起服务~3 分钟tokenspeed serve <模型> --port 8000
调 API即时OpenAI 兼容 SDK 直接接入

TokenSpeed 用「熟悉的参数 + 强大的默认值」把 LLM 推理引擎的上手门槛压到了最低。现在就挑一个你熟悉的模型,把tokenspeed serve跑起来吧!

【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeed

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询