想在没有独立显卡的电脑上跑大模型,常见麻烦不只是速度慢,还要安装 Python、CUDA 等一串运行环境。Project Zero 试图把这件事做成一个普通 C 编译器就能构建的单一程序:它只用 CPU,号称没有外部依赖,并支持 BitNet——一种把模型权重压缩到约 1 比特级、以减少存储和计算量的架构,以及 Qwen Bonsai-27B。
真正值得注意的是它处理压缩权重的方式。作者称,引擎不先把 BitNet 的三值权重还原成浮点数,而是让打包数据直接进入整数计算,少做一轮“拆包再换算”。在 4 核 Intel Xeon Emerald Rapids 上,它测得 36.25 tok/s(每秒生成的文本单位数),对照微软的 bitnet.cpp 为 19.33 tok/s,即 1.87 倍;在 i5-11300H 上则约快 1.23 倍。作者还称,至强测试已达到约 95% 的理论内存带宽上限。
不过,目前 BitNet 只在两台机器上测过,旧款 CPU 和更多服务器平台的表现仍待社区补充;Qwen Bonsai-27B 也只确认获得了纯 C 的 CPU 运行路径,材料没有给出其速度数据。上述性能均来自项目作者自述,尚非独立测评。