同样一套模型权重,换一种更贴合显卡“脾气”的摆放和读取方式,也可能跑得更快。alphatrad 为三张 Radeon AI PRO R9700 定制了 Q8_0_ROCMFPX:Q8 是用8位整数保存权重的量化格式;这次优化还按该显卡的执行方式调整向量点积宽度和线程调度。
作者自测显示,它比通用 Q8_0 小2.94%,完整模型解码快5.77%至5.87%;18组等工作量配对测试的中位提升为5.82%,其中17组更快。HumanEval 得分同为140/164,说明这次测试里代码能力没有下降。不过,标题所称的12.5%并未在正文数据中展开;更贴近实际使用的智能体端到端耗时只缩短2.21%,未达到作者预设的3%门槛。
它的意义不在于普遍提速,而在于证明硬件感知量化仍有余量:同为8位格式,针对特定GPU安排数据和解码内核,速度可以不同。代价也很明确:目前只能在 gfx1201 硬件上配合指定的 ROCmFPX 分支运行,不兼容上游 llama.cpp、Ollama、LM Studio 或 vLLM,且作者称仅有另外两人做过验证。