让 AI 同时替许多人执行任务,难点不只是模型够不够聪明,还要看回答能否又快又稳。TokenSpeed 是一个新开源的大模型推理引擎——也就是把训练好的模型真正跑起来,负责请求调度、显存管理和多 GPU 协作的软件层。它瞄准 Agent 工作负载,希望兼顾 TensorRT-LLM 级性能与 vLLM 级易用性。
项目把请求生命周期、KV Cache(保存已读上下文中间结果的显存缓存)归属和计算重叠时机写进有限状态机,并尝试在编译阶段保证缓存安全复用。它还用静态编译器预先生成多 GPU 通信计划,减少运行时开销。作者自述,TokenSpeed 在 Qwen3.5-397B-A17B 的 Agent 场景中达到 580 TPS——即每秒生成 580 个 token。不过现有材料未披露完整测试配置、并发条件和对照结果,“speed-of-light”仍是项目口号,后续公开基准才是关键。