Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.077 — 2026-09-19
PAPER H 4 约 1 分钟

LLM请求路由先校准再分流

路由器先按真实硬件校准,才能把请求分对地方;失准会让性能退化成“数队列”。

像餐厅领位一样,LLM 服务也要决定把新请求送到哪台机器。尤其在“预填充”和“解码”拆到不同 GPU 池后——前者负责一次读完输入,后者负责逐字生成——一次误判就可能让某台机器排长队,另一台却闲着。这项工作提出按预计完成时间分流:综合输入长度、预测输出长度、接入后的 KV cache 压力和 SLO 等级。KV cache 是模型保存的中间笔记;SLO 是服务承诺的响应目标。

最值得注意的不是“学会路由”,而是先校准。研究者在 8 张 NVIDIA A40 GPU 上发现,同一套路由策略若沿用模拟器参数,平均 goodput——达到响应目标的有效吞吐——会从 0.864 降至 0.819,P99 首字延迟也由 0.25~0.30 秒升至 0.42~0.52 秒。作者解释,成本估算一旦失真,路由器就会退化成简单地数队列,忽略请求实际有多重。换句话说,路由模型是否聪明还在其次,它对真实硬件耗时是否“有数”,已经会直接影响延迟和集群利用率。


供稿材料 SOURCES — 1

← 返回 2026-09-19 · 学术板块