Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.086 — 2026-09-28
NEWS 约 1 分钟

新优化器挑战Muon

Tauon在小型GPT实验中以更少正交化步骤,宣称损失更低、单步快约8.5%。

IMAGE — r/MachineLearning 日榜

训练AI像沿着误差指示的坡道下山:优化器负责决定每一步往哪走、走多远。新优化器Tauon试图把这件事做得更省算力。它与Muon都用正交化——把参数更新整理得更均衡——但作者通过频谱过滤和系数调度,把核心计算从多步压到两步,并用DCT-2缩小处理的矩阵。

作者在TinyShakespeare数据集上训练一款6层、隐藏维度512的GPT-Mini。按其自述,Tauon最终验证损失约1.60,低于Muon的1.65和AdamW的1.80;相同硬件上每步耗时391.5毫秒,较Muon的427.7毫秒快约8.5%,并接近AdamW的382.9毫秒。损失衡量预测与目标的差距,通常越低越好,但不等于模型在各种任务上都更强。

这个结果值得训练工程团队关注,因为大规模训练中,单步节省一点时间也可能积成可观成本。不过作者也直言,这只是一次“很小”的3000步实验;模型、数据集和算力规模都有限,Tauon是否真正优于Muon,仍需在固定条件下做更大规模的独立复核。


供稿材料 SOURCES — 1

← 返回 2026-09-28 · 科技板块