Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.028 — 2026-08-01
PAPER H 50 约 1 分钟

推理过程可以蒸馏到模型内部

让模型把“草稿”学进参数,少写推理过程也能答题,但效果取决于任务。

让 AI 解一道题,它常先写出长长的“草稿”,再给答案。这种思维链——模型生成的中间推理文字——可能帮助解题,却也拖慢回答、增加上线成本。Masked Distillation 想把这份草稿内化:让推理能力进入模型参数,而不是每次都完整输出。

训练时,学生模型只根据问题学习最终答案;教师模型仍先生成思维链,再据此评价学生的回答。作者还设计了折中方案:学生只输出教师推理过程末尾的一小段,把其余步骤压进参数。最值得注意的是,完全不写草稿并非处处有效:作者自述,它在小学算术数据集 GSM8K 上可行,却在陌生的数字拼算任务 Countdown 上失败;保留少量末尾推理步骤后,表现才接近教师,同时比完整输出更省生成量。

这说明“把推理藏进模型”不是通用开关,更像一只可调旋钮:模型越熟悉任务,越可能直接作答;面对陌生任务,仍需要一点外显步骤搭脚手架。


供稿材料 SOURCES — 1

← 返回 2026-08-01 · 学术板块