让 AI 解题时“写出过程”,往往比只报答案更有效。但它是真的学会了推理,还是恰好顺着提示找到了捷径?Xinyang Hu 等人在 JMLR 论文中,把思维链提示(Chain-of-Thought prompting,即在示例中展示中间推理步骤)重新表述为一个统计估计问题:模型像尝几口汤判断整锅味道一样,从有限示例推断当前任务的隐藏规律。
论文最关键的解释是:当预训练数据足够多时,思维链形成的估计器等价于贝叶斯估计器——模型先根据示例判断“这大概是哪类任务”,再综合各种可能性生成答案。作者还把误差拆成两部分:模型预训练本身的误差,以及从提示示例识别任务时产生的误差;在论文设定的适当假设下,后者会随示例增加而指数下降,也就是少量额外示范可能迅速排除错误理解。
不过,思维链并非逐题稳赢。理论只表明它在所有任务的期望表现上不差于普通的上下文学习;若中间步骤信息不足,有限示例反而可能拖累结果。这项工作的价值,正是给“写步骤更好”划出统计条件,而不是把更像推理的文字直接当成真实推理增益。