Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.068 — 2026-09-10
PAPER 约 1 分钟

缩放定律也能少做实验

用已有试跑训练“预报员”,把缩放定律从穷举网格改成按需实验。

训练基础模型前,团队常先做一批“小号试跑”,像反复调烤箱温度和时间,找出模型多大、数据喂多少最划算。问题是,传统做法会跑遍超参数——训练前设定的模型大小、学习步幅、数据量等旋钮——组成的网格,而最后拟合缩放定律时,通常只留下每档计算预算中错误最少的结果,其余试验很少直接影响曲线。

这篇论文把收集数据改写成贝叶斯优化:根据已有试跑判断下一次最值得试哪里。最巧的一步是“计算切片”:先在较小计算预算内搜索,再逐步开放更贵的区间,避免过早押注大实验。对于尚未训练的组合,代理模型会先“幻想”其结果,补成一张模拟的稠密网格,再据此拟合缩放定律。作者在既有缩放实验数据集上回放这一流程,称它能以明显更少的累计计算量逼近完整网格的拟合;但所给原文未披露摘要中具体的最高节省比例,结论也仍来自离线模拟。


供稿材料 SOURCES — 1
01
Amortizing Scaling Law Construction Costs arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-10 · 学术板块