Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.023 — 2026-07-27
NEWS 约 5 分钟

Mac靠SSD流式运行480B模型

Slipstream 按需从 SSD 搬运 MoE 专家,让 36GB MacBook 越级跑大模型,也暴露了速度与存储瓶颈。

你想在 MacBook 上运行一个远超内存容量的模型,就像要在小书桌上查阅一整座图书馆:书放不下,只能把常用页留在桌上,其余需要时再去书架取。Slipstream 做的正是这件事。它不强求整套模型进入内存,而是把暂时不用的部分留在 SSD,按需读取。

这条路线值得看,因为它试图改变本地大模型的门槛:不是继续压缩整套模型,而是少搬一些。作者称,一台配备 36 GB 内存的 MacBook 因而可以运行参数规模从 35B 到 480B 的编码模型。不过,目前所有数据均为项目作者自报,尚无独立复现;尤其 480B 只有标题中的笼统说法,没有具体模型、配置和速度,暂时只能视为待验证的能力上限。

不把整座图书馆搬上桌

Slipstream 面向 MoE(Mixture of Experts,混合专家)模型。这类模型包含多个“专家”参数模块,但处理每个 token——模型生成文字时使用的基本单位——通常只会激活其中少数几个。既然大部分专家此刻没有工作,就不必让它们一直占着内存。

作者从 llama.cpp 分支开发了 Slipstream。系统把每个 token 都会用到的权重常驻内存,只根据模型的路由结果,从 SSD 载入本次被选中的专家。SSD 是使用闪存的高速存储设备;这里的“流式”意味着权重不是一次性全部载入,而是边运行边读取。

已经读过的专家会进入一个容量受限的 RAM cache,也就是内存缓存。再次用到时,系统可以直接复用,不必重新访问 SSD。缓存还会拒绝任何可能触发 macOS 内存交换的加载。内存交换会把内存数据临时挪到磁盘,容易让本就依赖磁盘读取的流程进一步变慢。

这与我们此前报道的 Bonsai 是两条不同路线。Bonsai 用极低比特量化,让 27B 稠密模型接近普通设备的内存预算;Slipstream 则利用 MoE 每次只启用少量专家的结构,用更多 SSD 访问换取更低的内存门槛。

35B 能聊,118B 更像慢工

据作者公布的测试,Qwen3.6-35B-A3B 的 Q4 量化版本从内置 NVMe SSD 流式运行时,使用 10 GiB 缓存、缓存命中率为 78%,速度约为每秒 13 个 token;缓存增加到 14 GiB 后,约为每秒 19 个 token。命中率表示所需专家已经在内存缓存中的比例,越高,通常越少等待 SSD。

更大的 Laguna 118B-A8B 无法完整装进 36 GB 内存,但作者报告它仍能以约每秒 2.8 个 token 运行。作者将前者称为适合交互的主力,将后者定位为批量编码而非聊天。这里要分清“能运行”和“用起来顺手”:模型可以开始生成文字,不代表响应速度适合实时对话。

这些数字也不能简单归因于缓存大小。作者没有披露 MacBook 的具体芯片、SSD 型号与吞吐、上下文长度、提示词、生成长度、采样参数、首 token 延迟及重复测试次数,因此不同设置之间只能作项目内参考,不能当作普遍性能承诺。

真正卡住它的是搬运速度

作者报告,最大的单项提升并非来自更复杂的计算优化,而是把一个存放流式专家权重的文件移到更快的磁盘,性能随之提升 2.7 倍。这很符合方案本身的逻辑:模型把内存压力转移给了存储系统,SSD 的速度和连接方式自然成为关键变量。

一些看似聪明的办法反而没有奏效。在内置 NVMe 与较慢 USB SSD 共享总线的组合上,把数据分散到两块 SSD 并行读取产生了负收益。静态和在线推测预取——提前猜测下一步会用哪个专家——让性能下降 8%。为高频专家预留固定空间也使性能下降 1%至 6%,因为它压缩了通用缓存。

相反,零拷贝路径在实际缓存容量下带来了 13%至 24% 的提升,并已默认启用。零拷贝指尽量避免数据在不同内存区域之间重复搬运。作者此前因小缓存测试低估了它,这也提醒我们:局部实验的结论未必能直接外推到真实配置。

它把本地模型包装成了服务

Slipstream 提供内置推理引擎的原生 macOS 应用和 .dmg 安装包,无需自行编译。它通过 localhost:8080 提供本地模型服务,Kilo、Cline、Cursor 和 OpenCode 等客户端可连接使用,不必关心权重此刻位于内存还是 SSD。项目采用 MIT 许可证,作者称推理完全在本机进行,并已适配 Apple Silicon 与 Metal。

这让它不只是一个存储实验,也是一种更完整的本地使用方式:有限内存不再直接决定模型总参数量,真正的边界变成缓存命中率、SSD 吞吐和用户能接受的等待时间。

局限与未知

  • 所有性能结果来自同一位 Reddit 作者,没有独立复现,测试环境也缺少足够细节。
  • 480B 能力没有对应的模型名称、量化方式、缓存配置、上下文长度或生成速度,不能据此判断是否具有实用性。
  • 应用尚未经过 macOS notarization(苹果的开发者公证流程),首次启动需要右键选择“打开”,仍有安全提示与分发信任问题。

供稿材料 SOURCES — 1

← 返回 2026-07-27 · 开源板块