像人先学“推箱子”,再学“冰面打滑”,最后遇到“在冰面上推箱子”:真正会学习,不只是答出新题,还得把旧规律重新拼起来。Zhou 等人提出一套机器人操作基准,专门检验世界模型——预测“采取某个动作后,环境会怎样变化”的内部模型——能否边学边不忘。
它的关键设计,是让任务依次到来,并在序列末尾安排一道由先前基础任务重组而成的题。这样,研究者既能量出灾难性遗忘——新知识覆盖旧本领,也能观察组合泛化——模型是否会把学过的规律用于没见过的组合。基准还把重组拆成动作与感知两条轴,以定位知识复用究竟卡在哪里。
作者比较了多种世界模型与常见持续学习方法,并测试了由可复用组件构成的模块化模型。按论文自述,模块化设计在知识复用与遗忘之间取得了更好平衡,但仍未解决问题。这个结果的意义不在于宣布赢家,而在于把“学得快”拆开来看:模型究竟真的调用了旧知识,还是只善于重新适应。