Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.016 — 2026-07-20
NEWS 约 1 分钟

专用Q8让Radeon推理快12.5%

为Radeon R9700量身定做Q8格式,解码快约5.8%,但端到端仅快2.21%。

同样一套模型权重,换一种更贴合显卡“脾气”的摆放和读取方式,也可能跑得更快。alphatrad 为三张 Radeon AI PRO R9700 定制了 Q8_0_ROCMFPX:Q8 是用8位整数保存权重的量化格式;这次优化还按该显卡的执行方式调整向量点积宽度和线程调度。

作者自测显示,它比通用 Q8_0 小2.94%,完整模型解码快5.77%至5.87%;18组等工作量配对测试的中位提升为5.82%,其中17组更快。HumanEval 得分同为140/164,说明这次测试里代码能力没有下降。不过,标题所称的12.5%并未在正文数据中展开;更贴近实际使用的智能体端到端耗时只缩短2.21%,未达到作者预设的3%门槛。

它的意义不在于普遍提速,而在于证明硬件感知量化仍有余量:同为8位格式,针对特定GPU安排数据和解码内核,速度可以不同。代价也很明确:目前只能在 gfx1201 硬件上配合指定的 ROCmFPX 分支运行,不兼容上游 llama.cpp、Ollama、LM Studio 或 vLLM,且作者称仅有另外两人做过验证。


供稿材料 SOURCES — 1

← 返回 2026-07-20 · 开源板块