Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.027 — 2026-07-31
NEWS HN 881 约 6 分钟

2GB内存跑26B:Mac推理引擎爆红

TurboFieldfare 把26B模型的常驻内存压到约2GB,但要靠SSD边读边算,速度与适用范围仍待复现。

IMAGE — Show HN 高分帖(新项目发布流)
2GB 内存跑 26B:Mac 推理引擎爆红

你有一台 8 GB 内存的 MacBook,想在本机运行一个 26B 参数的大模型。通常的问题不是模型算不动,而是它根本装不进内存:TurboFieldfare 所用的完整 text-only 模型约有 14.3 GB。新开源引擎 TurboFieldfare 的办法,像是在小书桌旁放一排书架——桌面只留眼下需要的资料,其余内容用到时再从 SSD 取。

项目称,这样可以把 Gemma 4 26B-A4B 的权重与 4K KV cache 常驻占用控制在约 2 GB,并让它在 8 GB M2 MacBook Air 上生成文本。这也是标题里“2GB 跑 26B”的准确含义:不是整个模型缩成了 2 GB,而是用存储空间和频繁读取换取较低的内存占用。本文数字均来自项目自己的 GitHub 页面,尚无独立复现。

不是把模型塞小,而是边用边取

Gemma 4 26B-A4B 是一个 MoE(Mixture of Experts,混合专家)模型。它把模型的一部分拆成许多“专家”子网络,每生成一个 token——可以粗略理解为一小段文字——只调用其中少数专家。按项目说明,模型共有 26B,即 260 亿参数,但每个 token 约激活 3.88B 参数。

少算一些,不等于少存一些。全部专家的权重仍要放在某个地方。TurboFieldfare 将约 1.35 GB 的 shared core(各次生成都会用到的共享核心)和 FP16 KV cache 留在内存中,把暂时不用的专家权重放在 SSD。模型每生成一个 token,引擎再读取当下所需的专家。

KV cache 是模型保存上下文中间结果的“草稿纸”,可以避免生成新词时从头计算。它会随上下文变长而占用更多空间。因此,项目给出的约 2 GB 口径特指权重加 4K KV cache,并不代表所有使用场景都固定只占这么多。

项目使用 MLX affine 4-bit、group 64 的权重格式;router——负责决定该调用哪些专家的路由部分——采用 8-bit,共享专家和路由专家采用 4-bit。这里的 4-bit 和 8-bit,是用较低精度保存数字,以减少体积。安装后的完整 text-only 模型仍约占 14.3 GB;首次安装需要下载并重打包约 15 GB 数据。

为什么要自己写一套引擎

TurboFieldfare 不是 MLX 或 llama.cpp 的外层封装,而是用 Swift 和 Metal 编写的模型专用 runtime,也就是专门负责加载和执行这个模型的运行环境。Metal 是苹果设备的底层计算接口,开发者可以借它直接调度 Apple GPU。

“模型专用”意味着它能围绕这一个模型安排内存、SSD 读取和计算,但通用性也相对有限。项目目前提供原生 Mac app、命令行工具,以及一个实验性的本机 OpenAI-compatible Chat Completions server。后者允许现有客户端用类似 OpenAI 接口的方式调用本地模型。

安装器不会先把完整源 checkpoint——模型训练完成后保存的原始权重文件——再复制一遍。它会从固定的 Hugging Face 版本分段下载所需字节,并直接重打包为 .gturbo 格式,以免磁盘上同时出现两份完整模型。项目还整理了 103 项测量结果,覆盖计算 kernels、缓存、I/O、prefill 和 decode。prefill 是模型先读完提示词的阶段,decode 则是逐个生成新 token 的阶段。

能跑,和跑得舒服,是两回事

据项目作者测量,8 GB M2 MacBook Air 的 decode 速度为每秒 5.1—6.3 token;24 GB M5 Pro 为每秒 31—35 token。后一个数字明显更高,但两组结果不能直接当作芯片对比:内存容量、芯片代际、提示词和生成长度、文件页缓存状态都不同,作者也明确说这些条件会影响吞吐。

这条路线真正值得关注的地方,不是把 26B 模型“压缩成 2 GB”,而是改变了稀缺资源:过去首先受限于内存容量,现在可以让 SSD 承担模型仓库。对内存较小、但有约 14.3 GB 可用存储空间的 Mac,它降低了本地运行大模型的入场门槛。代价也很直接:每个 token 都可能触发专家读取,速度更容易受 SSD 带宽、访问延迟和缓存状态影响。

局限与未知

  • “any M-series Mac”是项目标题中的说法,但页面明确验证的目标只有 8 GB M2 MacBook Air。运行环境还要求 macOS 26、Metal 4、Swift 6.2,且仅支持 arm64;不能据此确认所有 M 系列 Mac 和系统组合都可用。
  • 约 2 GB 没有计入完整的 14.3 GB 模型存储,也不等于整台电脑运行时只需 2 GB。系统、应用、文件页缓存,以及更长上下文带来的 KV cache 增长,都可能提高实际资源占用。
  • 当前速度和内存数字都来自项目作者。还需要第三方在冷缓存、长上下文和持续对话等条件下复现,才能判断它是“能够启动并生成”,还是适合长期稳定使用。项目也提醒,模型可能重复或给出错误答案;目前只处理文本,不支持图像、音频和视频。

供稿材料 SOURCES — 1

← 返回 2026-07-31 · 开源板块