把一个 27B 大模型塞进桌面上的小型计算板,像把一整套工具压进随身包。开发者 Clean-Mention6543 在自己的 Jetson Orin NX 16GB 上,运行了 PrismML 的 Bonsai 27B。它有 269 亿参数,经 1-bit 量化——用极少的数值档位存储模型权重——压到 3.53 GiB,并完全离线推理。意义不只是“装得下”:本地运行能减少联网依赖,也少把数据传到远端。
按作者在自有设备上的测量,模型生成速度为每秒 6.75 个 token(模型生成文字时使用的小单位);整机输入功耗平均约 20.7W,峰值 24.6W。代价也很明确:这种 1-bit 格式需要自行编译 PrismML 修改版 llama.cpp,并用 CUDA 调用 GPU,不能直接交给 Ollama。作者称英文推理表现尚可,但韩文会混入其他语言字符并破坏技术术语,因此不建议用于非英文输出。这是个人设备上的单次实测,材料未提供独立复现或系统性的质量评估。