在 Mac 上让模型先读一大段材料,等待往往发生在正式回答之前。这个阶段叫 prefill(预填充)——模型把整段输入逐步转换成内部表示。问题可能不全在芯片:据开发者 maddie-lovelace 在 Reddit 分享,M5 已支持 W4A8,即权重用 4 位、激活值用 8 位计算,但 MLX 和 Mac 版 llama.cpp 目前仍普遍采用 16 位激活。换句话说,硬件已经准备好走一条更省计算的路,主流推理后端却还没接上。
作者自行编写 W8A8 内核后,在 M5 MacBook Air 的 Gemma4 预填充测试中报告约 1.4 倍提速:处理 130,173 个输入 token(模型切分文字后的基本单位)时,速度从原版的每秒 2,193 token 提升到 3,029。这个结果尚属单名开发者、单套测试的自述,也没有披露精度影响,但它点出了一块明确的优化空间:苹果本地推理下一步的增量,可能不只来自更强芯片,也来自 MLX、llama.cpp 这类连接模型与 Apple Silicon 的软件底座真正用上 8 位激活。