Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.017 — 2026-07-21
NEWS 458 STARS · 2 信源 约 6 分钟

显存不够,调度器替你拆模型

显存装不下大模型?ATSInfer 与 KTransformers 让 CPU、GPU 分工搬运和计算。

IMAGE — r/LocalLLaMA 日榜

你想在普通电脑上运行一个大模型,显卡却像一张太小的书桌:模型还没摆开,显存就满了。系统内存通常更大,但离 GPU 更远;频繁来回搬数据,又会让生成速度慢下来。ATSInfer 与 KTransformers 都在处理这道取舍题:不再要求 GPU 独自装下整个模型,而是让调度器安排 CPU、GPU 各自保存和计算合适的部分。

这里的 CPU–GPU 异构推理,是让两类处理器共同完成同一次模型运行。GPU 承担擅长的高吞吐计算,CPU 及其更大的内存接住显存放不下的部分。把模型权重或中间数据移出显存,叫作 Offloading(卸载)。它能扩展可运行的模型规模,但也可能把瓶颈从“装不下”变成“搬不动”。本文涉及的性能数字均来自各项目材料,尚无独立复现实验相互印证。

不只决定搬哪一层

以往的卸载系统常按整层或“专家”安排任务。专家是 MoE(Mixture of Experts,混合专家)模型中的子模块;模型每次只调用其中一部分。问题在于,同一层里的数据并不完全相同。张量——承载模型权重和中间结果的多维数字数组——大小和计算特征可能各异。整层搬运,就像搬家时把整个房间打包成一个箱子:省事,却无法把常用小物留在手边。

ATSInfer 把调度粒度缩小到张量。论文摘要称,它把三种安排结合起来:static tensor placement 预先决定一部分张量放在哪里;load-aware dynamic transfer 根据设备负载动态搬运;asynchronous CPU-GPU coordination 则让 CPU 与 GPU 异步协作,减少一方等待另一方的时间。调度器由此同时处理三个问题:数据存在哪里、何时移动,以及交给哪种处理器计算。

关键不只是“拆得更碎”。消费级电脑的负载会变化,CPU 算力、GPU 空闲程度和连接两者的 PCIe 带宽都有限。固定方案可能在一种状态下合适,换个负载就开始排队。ATSInfer 的思路,是先做相对稳定的放置,再根据当下负载调整传输。

据论文摘要的单一来源结果,ATSInfer 在消费级平台测试了 dense(稠密模型,每次计算通常会动用完整网络)和 MoE 模型。与现有系统相比,其 prefill throughput 最高提高 1.94 倍,decode throughput 最高提高 3.29 倍。Prefill 是模型先读完输入、建立计算状态的阶段;decode 是随后逐个生成 token——也就是文本基本单位——的阶段。后一个数字更直接关系到等待回答时的生成速度,但材料没有给出对应基线、模型配置和硬件细节,不能把“最高值”理解为所有设备上的普遍提升。

KTransformers 拆的是另一层任务

KTransformers 同样探索 CPU–GPU 异构计算,但不能与 ATSInfer 当成同一套方案。ATSInfer 强调张量级卸载;KTransformers 项目仓库明确写的是 CPU-GPU Expert Scheduling,即按专家调度,并以“热门专家放 GPU、冷门专家放 CPU”为使用方式之一。

据项目仓库,KTransformers 曾宣称可用 24GB 显存和 382GB 系统内存运行 DeepSeek-R1/V3,并获得最高 3~28 倍加速;它也曾把 DeepSeekV2 所需显存从 21GB 降到 11GB。仓库还列出 GPU–CPU–Disk 三层 prefix cache reuse:prefix cache 是复用相同输入前缀的中间计算结果,三层设计意味着缓存可按条件放在显存、系统内存或磁盘中。

这些例子共同说明了一条正在成形的路线:把“能否运行大模型”从单纯购买更大显存,转化为一个资源编排问题。显存仍然重要,但系统也可以根据数据的用途、热度和计算特征,决定哪些部分必须留在 GPU,哪些可以交给 CPU,哪些结果值得跨层缓存。模型没有变小,系统只是更精细地安排它在不同硬件之间展开。

为什么值得现在关注

这类工作把优化重点从单个计算内核,推向整台消费级设备。真正影响体验的,不只是 GPU 算得多快,还包括系统内存能容纳多少、数据搬运是否堵塞,以及 CPU 与 GPU 能否同时工作。ATSInfer 的张量粒度进一步说明,“一层模型”可能仍是过大的调度单位;KTransformers 则展示了 MoE 专家调度和多层缓存的另一种切入点。

它们还没有证明普通设备可以无代价地运行任意大模型。更准确的说法是:当显存成为硬限制时,细粒度调度正在尝试用更多系统内存和更复杂的协作,换取模型可运行性与可接受的速度。

局限与未知

  • ATSInfer 的 1.94 倍与 3.29 倍提升只有论文摘要及其转述支持;材料未披露基线、具体硬件、量化精度、上下文长度和分项结果,也无法确认代码是否公开。
  • KTransformers 的 3~28 倍加速与显存下降数字来自项目方,材料同样不足以判断其适用条件;“Day0 Support”表示项目宣称已适配,不代表性能和稳定性经过第三方验证。
  • 两个项目只能共同支持“CPU–GPU 协同是一条消费级推理路线”,不能用 KTransformers 的公开材料替 ATSInfer 的实现或性能背书。

供稿材料 SOURCES — 2

← 返回 2026-07-21 · 开源板块