老师批改作业时,也可能因提示语不同而改变判断。若学生把这种摇摆也当成知识照单全收,未必学得更好。在线策略蒸馏(让学生模型先生成推理过程,再由更强教师逐词指导)就有这个问题:每个词上的师生概率差距,不只反映能力差,也混入了教师自身受上下文影响的偏移;训练时教师若还能看到标准答案等“特权信息”,这种混杂可能更明显。
Cal-OPD的做法,是先用正、负两类特权提示,探测教师对同一个词的判断会在多大范围内摆动,再把落在这个范围内的师生差距视作不够可靠,不用于训练;只有超出范围的部分才成为学习信号。换句话说,特权信息不再直接教学生,而是拿来校准老师。
作者在数学推理基准上的实验显示,Cal-OPD只保留原始学习信号的约52%—65%,表现却在不同模型规模上持续超过标准方法及其变体,并缓解了回答越训越长的现象。不过,这个“教师自偏移区间”只是由有限提示估算,并非对教师所有上下文变化的完整刻画。