同一份长文档先交给小模型,再转给大模型,今天的系统往往会让两者各读一遍。新论文提出一层跨模型的上下文复用机制:把前一个模型留下的 KV 缓存——模型读完输入后保存的“阅读笔记”——翻译成后一个模型能理解的表示,从而少做一次预填充,也就是回答前从头处理全部输入的计算。
最值得注意的是,这种翻译不只用于同一家族的大小模型。作者在差异较大的 Llama3.1-70B 与 Qwen2.5-7B 之间测试时,报告准确率为 44.0%,接近后者自行读取上下文时的 45.7%;测得延迟则从 899 毫秒降至 138 毫秒。另一组跨家族实验中,4K 长度上下文的目标模型预填充成本最多减少 67.05%。这说明 KV 缓存或许不必永远锁在单个模型里,而能成为多模型服务间可转交的计算结果。不过,这些效果目前来自论文作者的实验,能否普遍适用于更多模型与真实服务负载,仍待验证。