教 AI 在手机上订票,不能只示范一次:它要反复点击、输入,再根据成败调整策略。问题是,这种强化学习——靠试错和奖励学会行动——若全在真机上进行,不仅慢,一次误操作还可能弄乱应用状态。WM-R1 的思路很直接:先让智能体在“内部模拟手机”里练。
这台模拟手机由世界模型驱动。它根据当前屏幕和一次操作,预测接下来会出现什么屏幕。论文把它接进全部 Rollout——也就是从任务起点一路操作到结束的完整尝试——从而在训练循环中取代真实 Android 环境。更具体的一步是,智能体可用 <call_wm> 先预演候选操作,看到预测结果后再决定最终动作,像点击“确认”前先看一眼后果。
作者用筛选出的 2000 个高难度任务训练模型,并以任务是否成功、路径长短和世界模型调用情况共同计分。作者自述,WM-R1 在 Android 基准测试中胜过只用 GRPO 强化学习及仅在推理时调用模拟器的方法。不过,这些效果来自论文实验;材料未披露模拟屏幕与真实应用之间仍有多大偏差。