小型本地模型有时像一道题做到一半便开始反复改口,在“但是,等等”的循环里越想越远。MindControl 想做的,是在解题途中递几张提醒纸条:它从 llama.cpp 分叉而来——即复制这个开源项目并独立修改——不重新训练模型,而是直接改动采样器。采样器负责从模型给出的下一 token(可理解为文字片段)概率中选出实际输出,因此干预会发生在生成当下。
据作者介绍,采样器看到 <think> 思考标签后,会先替模型写入一段自我提醒,例如要求在既定思考预算内保持简洁;当预算用到约 70% 时,再提醒它开始收束结论。达到上限后,系统会等待换行等较自然的位置,随后注入“现在回答用户”之类的文字,结束思考。思考预算只是内部推理文本的 token 上限,并不等于答案质量。
作者自述,这套办法在个人测试中能明显引导推理,但没有披露量化结果或对照实验。它更像一项值得观察的控制实验:不动模型本身,只在输出途中扶一把;提醒能否被遵从、答案是否真的更正确,目前仍未得到证明。