AI越会独立规划和推理,问题就越像把重要工作交给一个能力很强、思路却未必透明的新同事:不仅要看答案对不对,还要确认它是否始终受人控制。OpenAI首席科学家Jakub Pachocki在《An Alien Mind》中把这种能力增长放进对齐——让AI的目标和行为符合人类意图与约束——以及监测和治理的框架中讨论。
据OpenAI介绍,团队在2023年中的“RLSlow”项目里看到了可扩展推理模型训练的早期结果,Pachocki将其视为预训练模型形成自身思维链能力的转折。思维链是模型回答前的中间推导信号,可用来观察其计划,但并非可靠的“读心术”。他直言,目前没有任何实验室已把对齐和监测解决到足以长期以最高速度负责任扩展的程度;在形成共同安全门槛前,他希望前沿实验室普遍自愿减速,也呼吁各国政府优先推进国际协调。值得注意的是,文章称OpenAI保留思维链可监测性,首要考虑是安全观察,而防止模型蒸馏只是次要理由。