像做完形填空一样,AI先看一份被遮住大半的材料,再把缺失部分补回来。这种“掩码预训练”已广泛用于文本和图像,但一个基础问题始终缺少统一解释:补缺为什么能让模型学到可迁移到分类、识别等任务的“要点笔记”?Qi Zhang等人的JMLR论文尝试补上这块理论坐标。
作者证明,遮挡会隐式制造语义相近的“正样本对”,重建任务则把它们在模型的特征空间中拉近。这让掩码预训练与对比学习——让相似样本靠近、不同样本分开——有了共同语言。不过,只顾拉近也会造成“维度坍塌”:模型并未把所有输入都记成同一个答案,但实际使用的特征维度很有限。为此,作者提出U-MPT,让独立样本的表征彼此分散,并称其改善了多类下游任务。
论文最具体的解释落在遮挡比例上:遮得少,剩余内容更容易保留类别信息;遮得多,又更容易形成语义相近的正样本对。两者需要折中。作者据此设计指标,并报告它能在真实数据集上预测出实践中的最优遮挡比例75%。这套理论覆盖到什么范围、能否推广到更多模型,仍需继续检验。