Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.033 — 2026-08-06
NEWS HN 307 约 1 分钟

80B模型塞进4.3GB Mac内存

Swiftlet让80B Qwen用4.3GB内存运行,但省下内存要用存储读取和速度来交换。

IMAGE — Show HN 高分帖(新项目发布流)

大模型通常像一整套厚重工具箱,得先全部搬进内存才能开工。开源项目 Swiftlet 换了种办法:只把每次都要用的小型核心留在内存,再按需从 SSD 或手机闪存取出“专家权重”——模型处理当前文字时临时选中的那部分参数。作者称,4-bit(用较低精度压缩权重)的 Qwen3-Next-80B-A3B 在 Mac 上占用峰值内存 4.3GB,模型文件则需 42GB;35B 版本在 iPhone 17 上约占 2.5GB。

最具体的一步,是把大量专家权重重新排成固定间隔的数据块,让每次取一个专家只需一次存储读取,再用缓存留住常用专家。计算交给 Metal——Apple 设备调用 GPU 的接口。作者报告,M5 Mac 上 80B 版本生成速度为每秒 4.5至5个词元,35B 为7至11个;iPhone 上约每秒1个词元。问题在于,每次实际只启用约3B参数,作者也承认其知识回忆更像小模型。上述质量、内存与速度均来自项目自述,仍需独立验证。


供稿材料 SOURCES — 1

← 返回 2026-08-06 · 开源板块