Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.077 — 2026-09-19
PAPER H 3 约 7 分钟

OPEN-1B:把训练复现推进到比特级

Open-1B 把训练过程变成可逐步核账的公开账本,目标是让不同硬件算出完全相同的模型。

Open-1B:把训练复现推进到比特级

你拿到一道菜、完整食谱和全部原料,照着重做,成品还是可能略有不同。开放模型也有类似问题:即使作者公开模型权重、训练数据和步骤,别人重新训练时,计算顺序的一点变化也会让结果逐渐漂移。Open-1B 想把标准再推一步:不只公开“做了什么”,还要让外界能够逐步核对,确认发布的模型确实由所声明的数据和流程训练而来。

论文把这种标准称为“fully auditable”,即“完全可审计”。作者称,每个训练样本上的每项操作,都能在不同类型的消费级硬件上实现比特级复现——输出中的每一个二进制位都相同。需要先说明:本文所述能力、发布内容和实验结果均来自 Open-1B 论文,尚无独立信源交叉验证。

开放权重,为什么还不够?

模型权重是训练后得到的大量数字,相当于成品;检查点(checkpoint)则是训练途中保存的状态快照,可以包含权重、优化器状态等继续训练所需的信息。公开这些文件,能让别人运行或微调模型,却不能单独证明这些数字确实来自公开的数据和训练步骤。

麻烦来自浮点数。电脑只能用有限精度表示小数,因此 (a+b)+ca+(b+c) 可能得到末尾几位不同的结果。模型训练包含海量加法。GPU、CPU 或不同并行方案若改变求和顺序,微小误差便可能一路积累,最终形成不同的权重。

常见深度学习框架提供“确定性执行”:同一台机器、同一套环境重复计算,可以得到相同结果。但论文作者指出,这种保证通常不能跨硬件。Open-1B 追求的是更严格的比特级复现:无论用支持范围内的哪类设备重放,结果都要逐位一致。

先把所有“顺序”钉死

Open-1B 的关键思路并不神秘:既然结果会因运算顺序变化,就把可能变化的顺序全部固定下来。

第一层是单个算子。作者开发了 RepOps——一套跨硬件可复现的计算库。它让求和始终采用固定次序,并统一不同设备对融合乘加、极小浮点数和随机数的处理。例如,普通随机数生成器即使使用相同种子,也可能因设备和并行方式不同而给出不同序列;RepOps 改用按“种子加逻辑位置”直接计算随机值的方式,使结果不依赖任务如何分给计算核心。代价是硬件不能总按自己最快的方式计算。

第二层是数据顺序。普通分布式训练会把数据分给多块 GPU;设备数量一变,每块卡取得的数据及先后次序也可能改变。论文先定义一条不依赖集群规模的统一数据流,再把其中的训练窗口分派给设备。这样,换设备数量、从检查点恢复,或者在单机上重放某一步,看到的仍是同一批数据。

第三层是设备之间的通信顺序。分布式训练需要汇总多块设备算出的梯度。Open-1B 固定节点内和节点间的集体通信过程,使原本在集群中并行完成的步骤,可以在单台设备上依次重放。

三层合在一起,审计者便能选取大型训练中的任意一步,在一台受支持的设备上重算,再与公开训练轨迹核对。论文列出的支持平台包括 NVIDIA GPU、x86 CPU、ARM CPU,以及通过 Metal 运行的 Apple Silicon。

它公开了一份怎样的“账本”?

论文称,Open-1B 有 16.1 亿个参数,其中不计嵌入层的参数为 10.8 亿。模型在 48 块 H100 GPU 上训练,共处理 4000 亿个 token——token 是模型切分文本后读取的基本单位。训练持续 80,957 个优化步骤,活跃训练时间为 27.8 天,跨越 29.5 个日历日。

作者同时发布完整预训练数据集、每隔 100 步保存的中间检查点、训练与评测代码,以及 audit harness——用于重放并核验训练步骤的审计工具。预训练数据池约含 4505 亿个 token,实际训练使用其中 4000 亿;约八成来自网页,其余主要是代码、数学和科学材料。论文称,各数据源在训练中都未完整循环一次,因此没有文档被重复读取。

这里的重点不是 Open-1B 在能力榜单上领先。论文给出的对照中,Open-1B 用 4000 亿 token 训练后的开发集平均分为 25.4;OLMo 2 1B 在 4 万亿 token 后为 31.9。两者训练量并不相同,不能据此做简单优劣判断。Open-1B 的核心成果是展示一条可以核账的训练路径,而非刷新模型能力纪录。

一台机器不用重跑全部训练

完整重放一次训练,对消费级硬件并不现实。作者因此设计了“集体验证”:许多独立审计者各自核验不同训练步骤,合起来覆盖完整过程。它更像一本很厚的公共账簿,每个人检查其中几页,再把结果汇总,而不是要求某一个人从头算到尾。

论文还称,整次训练最终可归结为一个哈希值——哈希可以理解为文件或状态的数字指纹。任何一步发生变化,后续指纹都会不同。与只能给出概率性判断的 proof-of-learning 或 proof-of-training-data 相比,作者认为这种逐步比对更有机会发现未披露数据、偏见注入或后门。不过,这仍是作者对现有方法局限及自身方案能力的判断,不能当作已经经过广泛独立验证的结论。

为什么值得关注?

Open-1B 把“开放”的重点从交付文件推进到交付证据链。过去,开放权重回答的是“别人能否使用这个模型”;公开数据和配方回答的是“别人能否训练出相近模型”;比特级审计则试图回答更尖锐的问题:“这个成品是不是严格按照所声明的过程产生?”

这也改变了复现的尺度。研究者不必先承担完整重训的成本,才能检查某个环节。他们可以挑选单步,在不同硬件上重放,并把结果与公开轨迹逐位核对。若这种机制经得起第三方检验,模型训练就可能从依赖发布者信誉,向可分工核验的工程记录靠近。

局限与未知

  • “完全可审计”和“比特级确定”目前主要是论文作者的能力主张。材料没有显示已有独立审计者完成全程覆盖,集体验证方案也不等于实际已经覆盖全部步骤。
  • 论文列出了支持的硬件类型,但没有充分交代不同型号、软件版本和全部算子的适用边界。固定运算顺序也有性能成本;论文只披露量化步长每步重算约占 2% 的步时,未给出整套可复现机制的总成本。
  • 作者称已发布完整数据集和中间检查点,但现有材料不足以独立核实文件完整性、数据许可细节及长期可获得性。Open-1B 真正能否成为可审计训练的范例,仍取决于外部团队能否按其规则成功重放并持续核验。

供稿材料 SOURCES — 1
01
OPEN-1B: A Fully Auditable Training Run arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-19 · 学术板块