餐厅会按晚餐高峰备足人手,下午却难免有人闲着。LLM 推理集群也类似:它按流量峰值配置 GPU,低谷时昂贵算力长期空转。DeltaServe 想把这些空档交给微调——用针对性数据调整现有模型——同时守住 SLO,也就是对响应延迟等服务指标的承诺。
它选择 LoRA 这种省资源的微调法:冻结模型主体,只训练少量附加参数。关键在于,LoRA 训练的前向计算与 Prefill——模型先通读用户提示的阶段——结构相同,因此可塞进正在执行的推理批次。调度器会先预测微调带来的延迟,余量足够才放行;反向计算则在独立 GPU 进程中运行,每完成一层都可让路,新请求到来时暂停。
DeltaServe 的核心逻辑已接入 vLLM、SGLang 和 S-LoRA,只要求推理引擎支持同时处理多组 LoRA 参数。作者称,在 Nutanix 的生产流量记录上,它无需增加硬件即可完成微调,并保持全部推理 SLO;材料未给出可可靠引用的具体吞吐增幅。