Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.023 — 2026-07-27
PAPER H 8 约 1 分钟

Muon与SOAP冲向大模型预训练

Muon与SOAP在超大批次预训练中保持稳定,开始挑战AdamW的默认地位。

训练大模型像在浓雾里下山:优化器根据脚下坡度,决定每一步往哪走、走多远。AdamW长期是常见默认选择,因为稳定又省事;Muon与SOAP则会利用参数矩阵中不同方向的关联,重新调整梯度,试图少走弯路,但额外计算和数值不稳一直妨碍它们进入大规模预训练。

这篇论文最具体的进展,是把两种方法推到了最高720亿参数的MoE(混合专家模型,即每次只调用部分“专家”模块)和万亿级训练token。作者称,在单批最高1亿token的下一词预测中,Muon与SOAP仍能稳定训练并保持数据效率,而AdamW开始退化。团队还定位到SOAP的损失飙升源于预条件器——用于“拉正山谷坐标”的梯度缩放结构——没及时跟上当前梯度;改为每步更新正交基,并采用基于KL散度的协方差估计后,实验中的损失尖峰被消除。

作者进一步用逐层分布式实现隐藏通信开销,并开源代码。结果尚限于论文测试尺度,但它说明:高阶优化器若能同时守住速度、成本与稳定性,AdamW的默认地位并非不可动摇。


供稿材料 SOURCES — 1
01
SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-07-27 · 学术板块