AMD 消费卡,终于用上这条 INT8 快车道
在电脑上运行本地 AI,常见体验是:模型读材料时等得久,真正开始回答后又是另一种速度。llama.cpp 的一项新改动,正试图加快前面那段“读题”过程。它为 AMD RDNA3、RDNA4 显卡接入 INT8 cooperative matrix 矩阵乘法;一名 Radeon RX 7900 XTX 用户的自报测试显示,提示处理速度最高提升约 27%,但生成速度的增幅只有约 2%—5%。
这里的 llama.cpp 是一套常用的本地模型推理工具。Vulkan 是它调用不同厂商 GPU 的跨平台底层接口。INT8 则是用 8 位整数表示和计算模型数据的低精度方案,通常可以减少数据搬运并提高吞吐。Cooperative Matrix——协作矩阵——让一组 GPU 线程共同处理小块矩阵乘法,而神经网络的大量计算恰好都落在矩阵乘法上。
硬件没换,通路接上了
这次提交由 angt 为 RDNA3、RDNA4 编写相应的 Vulkan shader,也就是交给 GPU 执行的计算程序。它的意义并不是让显卡突然获得新能力,更像是给已有的机器接上合适的传动轴:硬件支持相关矩阵指令,但 llama.cpp 此前还没有把这条 INT8 路径充分接入。
据 ggml-org/llama.cpp GitHub 与 Reddit r/LocalLLaMA 的记录,该实现以 PR #27952 合入,并进入 llama.cpp 的 b11160 构建。它覆盖 RDNA3 与 RDNA4;不过目前给出的性能数字只来自 RDNA3 的 RX 7900 XTX,不能据此断言 RDNA4 也能获得相同幅度的提升。
快得最多的是“读题”
唯一一组公开成绩来自用户 nickm_27。测试使用 RX 7900 XTX、Vulkan 后端,以及标为“gemma4 26B.A4B Q4_0”的模型,文件大小 13.26 GiB、参数量标注为 25.23 B。
在 pp512 测试中,速度从每秒 3410.53 token 提升至 4331.21 token,约快 27.0%。pp 可以理解为 prompt processing,也就是模型先读取并处理输入内容。到了 tg128,也就是 token generation——模型逐字生成回答——速度仅从每秒 135.64 token 升至 142.76 token,约快 5.2%。
上下文变长后,收益继续收窄。在 d8192 条件下,提示处理约提升 16.5%,生成约提升 4.0%;到 d16384,分别约为 12.8% 和 2.0%。换句话说,这项优化目前最值得期待的场景,是更快地消化输入,而不是让回答阶段出现同等幅度的跃升。提交者所说的“massive improvement”因此只能代表其个人感受,实际变化明显取决于任务。
为什么值得关注
我们此前报道过 llama.cpp 为 RDNA4 优化 Flash Attention,以减少长上下文计算中的显存往返,也关注过 R9700 在特定任务中的本地推理提速。这次变化更底层:它直接补上 INT8 矩阵乘法实现,并把目标范围扩展到 RDNA3 与 RDNA4。
这对 AMD 消费卡的意义,不只是一张跑分表。软件能否调用硬件已有能力,往往决定一张卡在本地推理中究竟“值不值”。如果这条路径能在更多模型和设备上稳定复现,AMD 消费卡的本地推理性价比可能被重新评估。眼下更准确的说法仍是:7900 XTX 上已经出现了一个积极、但尚待复核的信号。
局限与未知
- 所有性能数据都来自同一名用户、同一张 RX 7900 XTX,没有第二硬件平台或第三方复测,也缺少完整驱动版本与测试环境信息。
- 材料没有提供 RDNA4 实测,因此不能把 RX 7900 XTX 的结果推广到 RDNA4,更不能泛化为所有 AMD 显卡。
- “gemma4 26B.A4B”可能存在命名或版本歧义;具体测试命令、Vulkan 扩展支持情况也未完整披露。