Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.033 — 2026-08-06
PAPER 约 6 分钟

拆分式推理,先补网络拓扑课

TopKV让拆分式推理先看清GPU连接远近,再搬运庞大的KV缓存;思路关键,但性能仍待真机验证。

你可以把拆分式推理想成一家把“备菜”和“出餐”分在两间厨房的餐厅。分工能让每间厨房用最合适的设备,但备好的东西必须及时送过去。如果两间厨房只隔一道门,推车就够了;如果隔着园区甚至城市,运输本身会拖慢出餐。

大模型现在也遇到了这个问题。拆分式推理(disaggregated inference)把读取整段提示的 Prefill 阶段和逐词生成答案的 Decode 阶段放进不同 GPU 池。前者集中做计算,后者不断读取内存,两者分开配置资源更方便。代价是,每次 Prefill 完成后,都要把 KV Cache 搬到 Decode GPU。KV Cache 是模型阅读提示时留下的一份中间结果,类似生成答案前记下的草稿,后面每生成一个词都会用到。

论文提出的 TopKV,核心想法并不复杂:搬运前先看地图。系统先识别 GPU 之间到底由什么链路连接,再据此安排传输、任务位置和缓存去向。值得注意的是,论文目前主要提供系统设计、组件实现和分析模型,不是一次已经在完整异构集群上跑通的性能验证。下文效果数字均来自这一篇论文,尚无独立信源交叉印证。

真正的瓶颈,是那份“草稿”太大

以论文讨论的 Llama-3-70B 为例,一段 4K token 的提示会产生约 2.6 GB KV Cache。若系统每秒处理 100 个请求,理论上的合计搬运需求达到 260 GB/s。论文也概括称,生产规模下的需求会超过 100 GB/s。

这时,GPU 在机房里的物理位置就很重要。数据中心网络拓扑描述 GPU、服务器和机房之间怎样连接。同一个 NVLink 域内,论文给出的双向聚合带宽是 900 GB/s;跨节点的 InfiniBand 是 50 GB/s;跨数据中心 TCP 则是 12.5 GB/s。最高相差 72 倍。

不过,这组数字混合了不同链路和带宽口径,更适合说明“连接远近会造成巨大差异”,不宜当作严格的同条件横向测试。

RDMA——让一台机器直接读写另一台机器内存、减少 CPU 参与和数据复制的通信方式——并不会抹平这种物理差异。论文称,DistServe 使用固定 RDMA 协议;Splitwise 把两个阶段放在同一台机器上,以较少的调度弹性避开跨节点传输;Mooncake 的 KV 存储按容量放置,没有考虑互连距离。对这些系统的概括来自 TopKV 作者,本文没有用原系统论文逐项复核。

先认路,再决定怎么搬

TopKV 在启动时读取硬件信息,包括 NVLink 连接、PCIe 层级、RDMA 能力和 Kubernetes 节点标签,由此建立一张互连图。每次搬运 KV Cache 时,它再按源 GPU 与目标 GPU 的关系选通道:同一 NVLink 域走 NVLink;同机但跨域走 PCIe;跨节点走 RDMA;条件不满足时退回 TCP。

这就是拓扑感知调度:不只看哪块 GPU 空闲,也看它与数据所在地离得多“远”。好比安排仓库时,不能只数空货架,还要看货架离装卸口有多远。

论文还设计了逐层流水传输。模型不必等全部 Prefill 结束后再一次性搬走缓存,而是在某一层算完后就开始发送该层结果,让通信与后续层计算重叠。作者的分析模型估计,这能把 60%—85% 的传输延迟藏在计算时间里;在部分 NVLink 情形下,传输甚至可以完全被计算覆盖。但当前实现只做了重叠时间估算,尚未实现真实并发流水,因此这些比例是模型结果,不是真机测量。

MoE 不能只顾专家,也要顾路程

对于 Mixture-of-Experts(MoE,混合专家)模型,问题又多一层。此类模型把计算分给许多“专家”模块,每个 token 只激活其中一部分。传统安排可能把请求送到最合适或最空闲的专家,却让 KV Cache 绕远路。

TopKV 因此把专家调度和缓存位置放进同一个成本模型。它提供三种策略:优先去缓存已经所在的 GPU;优先去常用专家所在的 NVLink 域;或按专家负载分流。系统综合估计 KV Cache 搬运时间、专家通信时间和目标队列长度,再选择去向。这里真正的新角度,是不再把模型计算与数据搬运当成两张互不相干的表。

论文还设想用 CXL 3.0 内存扩展器充当共享溢出层,在 GPU 的 HBM 放不下更多 KV Cache 时接手。模型配置中,每个节点配置四个 128 GB 端点,共增加 512 GB。作者估算其容量约为 80 GB HBM 的 6 倍,相比 NVMe 延迟低 86 倍、带宽高 9 倍。但 CXL 部分目前只是性能模型,论文没有硬件驱动或真实设备评测;比较所用设备与指标口径也披露不足。

为什么值得现在关注

拆分 Prefill 和 Decode,本来是为了更细致地使用 GPU。TopKV 提醒我们:计算拆开以后,网络不再只是后台设施,而会直接进入推理调度的核心决策。省下来的计算资源,可能被一段放错位置的传输重新吃掉。

按照论文对三种架构的预测性分析,拓扑感知选择相对固定使用 RDMA,可把传输延迟降低 3—18 倍。这个区间描述的是分析模型中的预期收益,尤其依赖源端和目标端是否恰好共享高速链路,不能写成已经在生产集群验证的结果。

TopKV 的价值因此更像一张有待实地检验的施工图。它把拓扑发现、传输选择、MoE 路由和缓存溢出放进同一套编排思路,也明确指出了拆分式推理继续扩张后,数据中心需要补上的“网络拓扑课”。

局限与未知

  • 现有传输组件用限速模拟器建立带宽模型,并未真正调用 CUDA IPC 或 RDMA 底层接口;逐层流水同样只有分析模型。
  • 作者尚未在具备 NVLink、InfiniBand 和异构链路的多节点集群上完成端到端评测,也没有验证传输与推理争用同一互连时的影响。
  • CXL 3.0 层仍是假设性设计。论文称相关硬件尚未在 GPU 云中可用,因此 6 倍容量、86 倍低延迟以及整体 3—18 倍收益都需要未来真机复核。

供稿材料 SOURCES — 1
01
Topology-Aware Data Movement for Disaggregated GPU Inference arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-06 · 学术板块