你让 AI 算出 127,工具却递来 137。它可能看出工具错了,最后仍写下 137。工具、检索和用户会不断给 Agent 补充信息;这些信息怎样改写模型已经形成的判断,决定了外部帮助究竟是在纠错,还是把错误放大。
Kawada 与 Kellis 把这个过程称为“证据整合”——模型依据新材料,重新分配各个候选答案的概率。他们在 12 个模型、8 类任务、逾一千万次试验中发现,模型更容易接受自己原本就偏向的答案,包括与自身典型错误一致的答案。最值得警惕的是,“看懂证据”不等于“让判断受它控制”:按作者报告,模型单独检查时虽能正确否定错误候选,实际作答时仍有 93%—100% 的概率采用它;在未参与前期分析的物理与生命科学题目中,采用率最高达 99.4%。这意味着可靠 Agent 不能只增加一道验证提示,还要确认验证结果是否真正改变最终决策。