学新任务后,AI 常像一个还记得规则、却突然不会操作的玩家。Gurp Nijjer 的研究把这种“灾难性遗忘”拆开检查:在模型式强化学习中,世界模型负责在脑内预演后果,Actor(策略)负责真正出招。即使无限回放旧经历,普通方法仍未能保住四项连续任务;但作者发现,世界模型对旧任务的奖励、价值和结束条件等信息基本仍在,崩掉的主要是 Actor。
这让“梦境重演”有了更明确的修补对象:世界模型生成旧任务的模拟经历,再挑出较好的轨迹,让 Actor 用监督式自我模仿重新练习。冻结同一个世界模型、使用相同模拟数据时,常规强化学习在 3 个随机种子中均未找回旧技能,自我模仿则 3 次全部恢复,而且不再与真实环境互动。训练中穿插这套方法后,四任务和八任务序列均有 3/3 种子通过,普通回放在四任务上为 0/3。不过实验只覆盖 MiniGrid 和一套约 1700 万参数的智能体,能否推广到更大场景仍未知。