Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.028 — 2026-08-01
PAPER 约 1 分钟

数据见底后,扩算力还划算吗

高质量数据见底后,重复读和改写旧材料的收益会递减,扩算力未必仍是最优解。

好比一本书已经读完,继续加时间只能重读或换种说法再读:投入更多精力,收获却不会等比例增加。AI 预训练也正遇到这个问题。经典缩放定律——估算模型、数据和算力如何搭配的经验公式——默认新鲜数据可以不断增加;但高质量语料见底后,新增算力往往只能用来重复旧文本或训练其改写版本。

这项工作提出 Compute-Data(CD)缩放定律,关键是给“衍生词元”打折。词元是模型读取文字的小片段;重复或改写产生的词元,价值按它相当于多少新词元来计算。作者在 Dolma-3 语料上训练了 1400 万至 6 亿参数的模型,比较多轮重复与改写,发现这个折扣并非常数:它同时受模型大小、每个参数读了多少词元以及衍生数据量影响,而且扩充到一定程度后会饱和。换句话说,模型越大、已有数据越多,拿算力替代新数据的边际收益越低。作者据此将训练分为算力受限、数据受限和模型受限三种状态,并称经典的算力最优分配在多数实际区间并非最优。


供稿材料 SOURCES — 1
01
Bridging Compute- and Data-Optimal Pretraining arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-01 · 学术板块