模型有时已经算出答案,却还在反复验算,像考生做完题后迟迟不肯交卷。SABER要解决的就是:长链推理——模型回答前写出的连续中间步骤——何时已经“够了”,可以提前退出,少做无效计算。
它的关键做法很直观:在推理途中分出两条短支路。一条让模型直接总结答案,另一条故意暗示“前面的推理错了,请改正”。随后比较两边给出的答案和置信度——模型偏向某个答案的程度。如果这种“唱反调”仍推不动结论,SABER就把它视为答案已经稳定,停止继续推演。与只看置信度不同,这相当于主动测试结论经不经得住干扰;探测只生成面向答案的短续写,不必把每条支路完整算到底。
作者称,SABER无需额外训练,在多个推理基准和模型架构上平均减少了30.2%至39.8%的推理 token,同时保持与完整长推理有竞争力的准确率。