Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.061 — 2026-09-03
PAPER H 7 约 1 分钟

GUI智能体先在世界模型里练

WM-R1让手机智能体在“模拟手机”里试错,减少训练对真机操作的依赖。

教 AI 在手机上订票,不能只示范一次:它要反复点击、输入,再根据成败调整策略。问题是,这种强化学习——靠试错和奖励学会行动——若全在真机上进行,不仅慢,一次误操作还可能弄乱应用状态。WM-R1 的思路很直接:先让智能体在“内部模拟手机”里练。

这台模拟手机由世界模型驱动。它根据当前屏幕和一次操作,预测接下来会出现什么屏幕。论文把它接进全部 Rollout——也就是从任务起点一路操作到结束的完整尝试——从而在训练循环中取代真实 Android 环境。更具体的一步是,智能体可用 <call_wm> 先预演候选操作,看到预测结果后再决定最终动作,像点击“确认”前先看一眼后果。

作者用筛选出的 2000 个高难度任务训练模型,并以任务是否成功、路径长短和世界模型调用情况共同计分。作者自述,WM-R1 在 Android 基准测试中胜过只用 GRPO 强化学习及仅在推理时调用模拟器的方法。不过,这些效果来自论文实验;材料未披露模拟屏幕与真实应用之间仍有多大偏差。


供稿材料 SOURCES — 1

← 返回 2026-09-03 · 学术板块