Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.067 — 2026-09-09
PAPER 约 5 分钟

模型的“自信”真的会支配行动

一项因果实验显示,LLM不只会报告“自信”,还会据此决定回答还是弃答。

你问 AI 一个拿不准的问题,它是硬着头皮给答案,还是坦白说“不确定”?这不只是礼貌差异。尤其在医疗等高风险场景里,一个低把握的错误答案,往往比拒答更危险。真正关键的问题是:模型是否知道自己有多大把握,并用这种判断控制行动?

Nature Machine Intelligence 这项研究给出的答案是:至少在“回答或弃答”的受控问答场景中,会。研究者不仅观察到置信度与弃答相关,还主动改变模型内部的置信信号,发现弃答行为随之变化。不过,以下结果均来自同一篇论文,尚无独立研究交叉验证,也不能外推为“置信度支配模型的一切行动”。

会说“没把握”,不等于真会照此行动

过去常见的问题是让模型给自己的答案打分。但“能说出置信度”和“会使用置信度”是两回事。一个人可以口头说自己只有五成把握,下注时却仍像胜券在握。

这里的置信度,指模型对答案正确可能性的内部估计。置信度校准则看这种估计是否可信:如果模型声称有 80% 把握的一批问题,长期约有 80% 答对,才算校准良好。它与准确率不是一回事。

研究团队设计了四阶段实验,使用来自事实性数据集的四选一问题。第一阶段没有“弃答”选项,研究者先测两类置信信号。一类来自 token log probabilities,也就是模型生成答案时分配给候选文本的概率;另一类是 verbal confidence,即让模型在单独一次处理过程中明确说出自己有多确定。这样测得的是作答决定之前的信号,不会被“现在可以不答”这个选项干扰。

先看门槛,再动内部信号

第二阶段加入弃答选项。结果显示,LLM 会对内部置信度应用一个隐含门槛:低于某个水平更容易弃答,高于门槛则更容易作答。论文称,置信度对弃答的效应量约比其他候选机制高一个数量级。不过摘要没有给出具体效应量、比较对象和不确定性区间,因此不宜把这句话解读得更精确。

但相关性还不够。也许模型并非依据置信度行动,只是置信度和弃答碰巧受同一因素影响。第三阶段因此采用 activation steering——直接推动模型内部某类激活状态朝特定方向变化。可以把它理解为不改题目,而是轻推模型内部的“把握感旋钮”。

研究者增强置信信号后,模型更少弃答;抑制置信信号后,模型更常弃答。中介分析——用来判断干预通过哪条路径影响结果的统计方法——进一步显示,置信度的重新分布是行为改变的主要机制。这构成了论文所说的因果证据:置信信号不只是伴随弃答出现,而是参与驱动了决定。

模型还能调整自己的“谨慎程度”

第四阶段检验的是另一层能力。研究者要求模型在不同置信水平下弃答,模型会随指定门槛调整行为。这意味着它不只拥有某种内部信号,还能读取信号,并据此改变弃答策略。

换句话说,模型的行为可以拆成两步:先形成“我有多大把握”的内部表征,再用一道门槛决定是否作答。论文把这种组合称为 structured metacognitive control,即“结构化的元认知控制”。元认知说白了就是判断自己答得靠不靠谱,并用判断调节行为。但论文的表述只是说结果与这种解释相容,并未证明模型具有人类式的自我认识。

为什么值得关注

这项工作的价值,在于把研究焦点从“我们能否从输出中猜出模型的信心”,推进到“模型自己是否用信心控制决定”。这直接关系到可靠部署:弃答门槛太低,模型会在没把握时乱答;门槛太高,它又会拒绝本来能回答的问题。若内部置信度确实参与决策,校准和拒答机制就不能只盯着最后一句话,还要理解内部信号与决策门槛怎样配合。

研究还发现,verbal confidence 在所有受测模型中都能独立预测弃答,即使它区分答案正确与否的能力较弱。这一点很重要:模型说出的“自信”可能影响它是否行动,却未必可靠反映答案是否正确。能驱动行为,不等于校准良好。

activation decoding——从模型内部激活中解码信息——还显示,token 概率和口头置信度都只是更丰富、多维内部置信表征的有损读出。也就是说,我们看到的几个数字或一句“我很确定”,更像内部状态投下的影子,而不是它的全貌。

局限与未知

  • 论文直接检验的是四选一事实问答中的“回答或弃答”,不能据此断言置信度普遍支配模型或自主智能体的所有行动。
  • 供稿所含原文未披露受测模型名单、样本规模、具体效应量及不确定性区间,“所有模型”和“高一个数量级”都应限定在论文实验范围内理解。
  • 口头置信度虽能预测弃答,却较不擅长区分答案正误。未来的可靠系统仍需同时解决“模型是否按信心行动”和“这种信心是否值得相信”两个问题。

供稿材料 SOURCES — 1

← 返回 2026-09-09 · 学术板块