像餐厅领位一样,LLM 服务也要决定把新请求送到哪台机器。尤其在“预填充”和“解码”拆到不同 GPU 池后——前者负责一次读完输入,后者负责逐字生成——一次误判就可能让某台机器排长队,另一台却闲着。这项工作提出按预计完成时间分流:综合输入长度、预测输出长度、接入后的 KV cache 压力和 SLO 等级。KV cache 是模型保存的中间笔记;SLO 是服务承诺的响应目标。
最值得注意的不是“学会路由”,而是先校准。研究者在 8 张 NVIDIA A40 GPU 上发现,同一套路由策略若沿用模拟器参数,平均 goodput——达到响应目标的有效吞吐——会从 0.864 降至 0.819,P99 首字延迟也由 0.25~0.30 秒升至 0.42~0.52 秒。作者解释,成本估算一旦失真,路由器就会退化成简单地数队列,忽略请求实际有多重。换句话说,路由模型是否聪明还在其次,它对真实硬件耗时是否“有数”,已经会直接影响延迟和集群利用率。