把厨房里切菜的速度提高29倍,不代表一桌菜也能快29倍上桌:备料、传菜和等待仍要花时间。开发者 shifu_legend 用 C99 从零编写了一个 CPU 推理引擎,让 BitNet 的三值模型——权重只有三种取值的压缩模型——无需 Python、BLAS 或 GPU 也能运行。这次实测的价值,正是把一个耀眼的局部数字拉回整机视角。
作者用 AVX-512——部分 x86 处理器用于并行处理多份数据的指令集——重写矩阵乘计算内核,把每字节打包的三值权重从4个增至5个。单独测试时,速度从标量基线的 2.5 Gop/s 升至 74.6 Gop/s,约快29倍。但复查发现,测试用 Xeon 上的 BitNet 解码已经用到约95%的 DRAM 带宽:处理器算得再快,也常在等内存送来数据。
因此,作者估算真正的端到端提升只有约6%至10%。端到端性能统计从输入到输出的完整过程,也包含权重读取、内存搬运和其他计算,更接近日常体验。更关键的是,这个新内核目前尚未接入实际调度路径,虽已和标量版本核对正确性,却仍处于闲置状态。29倍是已测的局部结果,整机提升则还是作者估算;这也提醒开发者,优化前先确认时间究竟耗在哪一层。