Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.070 — 2026-09-12
PAPER H 3 约 1 分钟

长提示预填充也要赶截止时间

SLOWeave按出字期限动态切分长提示,在少卡顿的同时提高有效吞吐。

你一边看 AI 回答,一边又递给它一份长材料,屏幕上的字可能突然停住:服务器正忙着“读材料”。这一步叫预填充(prefill)——模型回答前读完提示并建立缓存;与此同时,其他回答还要逐个生成 Token。固定大小的预填充分块很难两全:块小,反复调度拖累吞吐;块大,又会让出字卡顿。

SLOWeave 的做法像见缝插针。每轮调度时,它先找出所有正在生成的请求中最近的下一 Token 截止时间,再用耗时预测模型,通过二分搜索选出能在期限前完成的最大预填充块。若塞不下任何一块,就只安排生成。这样无需针对不同负载反复手调块大小;在预测准确且单纯生成本就来得及的前提下,作者还证明了它能在不耽误任何当前请求的范围内,让本轮预填充推进最多。

在论文的模拟器和 GPU 运行实验中,以逐 Token 延迟不超过 25 毫秒为目标,作者称其有效吞吐较最强固定分块基线在混合请求和长上下文请求上分别提高 39% 和 38%;目标收紧到 10 毫秒时,提升分别为 3.3 倍和 2.4 倍。结果仍依赖耗时预测是否可靠,持续过载时也需配合准入控制。


供稿材料 SOURCES — 1

← 返回 2026-09-12 · 学术板块