Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.019 — 2026-07-23
PAPER H 4 约 1 分钟

QUADS让FP4参与MoE强化学习

QUADS对齐训练与推理误差,让MoE强化学习稳定使用NVFP4采样。

像用一把刻度很稀的尺子反复校准机器:尺子虽快,误差却会越积越大。MoE(混合专家模型,每次只调用部分“专家”子网络)做强化学习时,要大量生成候选回答再按得分学习;这一步叫 rollout,往往最耗时。NVFP4——用4位数值计算的英伟达量化方案——能加速生成,但论文发现,直接让它负责 rollout、再用BF16训练,约150步后就会崩溃。

QUADS抓住了一个关键点:真正主导失稳的不是权重误差,而是激活值误差——也就是模型每次计算时临时产生的中间数值被粗糙舍入。它在训练侧模拟权重量化、保留高精度激活;在生成侧则对误差较大的激活通道再补偿一次,让两边对同一回答的概率判断更接近。

据作者实验,QUADS在四项留出基准上的平均 pass@1 为72.86%,接近BF16的73.15%,高于直接使用NVFP4的51.37%;rollout吞吐量也比FP8高16%。这些结果目前来自论文自述。


供稿材料 SOURCES — 1

← 返回 2026-07-23 · 学术板块