大模型通常像一整套厚重工具箱,得先全部搬进内存才能开工。开源项目 Swiftlet 换了种办法:只把每次都要用的小型核心留在内存,再按需从 SSD 或手机闪存取出“专家权重”——模型处理当前文字时临时选中的那部分参数。作者称,4-bit(用较低精度压缩权重)的 Qwen3-Next-80B-A3B 在 Mac 上占用峰值内存 4.3GB,模型文件则需 42GB;35B 版本在 iPhone 17 上约占 2.5GB。
最具体的一步,是把大量专家权重重新排成固定间隔的数据块,让每次取一个专家只需一次存储读取,再用缓存留住常用专家。计算交给 Metal——Apple 设备调用 GPU 的接口。作者报告,M5 Mac 上 80B 版本生成速度为每秒 4.5至5个词元,35B 为7至11个;iPhone 上约每秒1个词元。问题在于,每次实际只启用约3B参数,作者也承认其知识回忆更像小模型。上述质量、内存与速度均来自项目自述,仍需独立验证。