让 AI 看图、视频或听音频时,系统要比纯文字多做一步:先把这些内容变成模型能处理的数字表示。EAServe认为,成熟的“预填充—解码”分离架构因此还不够,多模态服务应按 Encode(编码)、Prefill(预填充,通读输入并建立缓存)和 Decode(解码,逐词生成答案)三阶段来调度。
关键矛盾出在入口。单个编码任务太小,难以吃满 GPU;但若简单攒成小批次处理,又会突然把大量请求推给后两段。论文实验中,加入微批处理后,吞吐从每秒 0.75 个请求升至 1.09 个,平均首词等待从 367.4 秒降至 112.1 秒,但平均逐词延迟反而从 179 毫秒升至 411 毫秒。
EAServe于是把 Encode变成整条流水线的“交通指挥”:按负载决定何时放行,并把部分预填充工作放到编码 GPU 的空闲算力上,同时动态划分计算资源。作者在图像、视频和音频模型上的实验称,在相同延迟目标下,其合格请求吞吐最高分别达到 NVIDIA Dynamo 和 vLLM 的 4.3 倍与 1.7 倍。