你让 AI 帮忙改日程、查通勤时间,再发一条消息。单看每一步,它似乎都会;可一旦连续切换几个应用,它可能办到一半迷路,还告诉你“已经完成”。AndroidLife 想检验的正是这种落差:手机 Agent——能代替用户点击、输入和切换应用的 AI 系统——究竟能不能在真实手机上可靠地忙完一天。
项目作者让 Qwen3.8-27b 以文本模式连续执行 60 项任务。结果成功率为 56.7%,也就是约 43.3% 失败。这个数字来自一次特定模型、特定模式的运行,不能泛化成“所有手机 Agent 都有四成失败”。本文数据均来自 AndroidLife 项目作者发布的一篇 Reddit 帖文;帖子虽附有榜单和任务轨迹,但供稿未提供可独立核对的页面摘录。
难的不是点一下,而是一路不出错
AndroidLife 是一套 benchmark,也就是用固定任务和统一规则比较系统的基准测试。它公开了 60 项任务,取自覆盖 28 天、31 个应用的 530 项任务语料库。测试通过 Wi‑Fi 操作真实手机,而非模拟器,并以手机最后的实际状态评分,不采信模型自己说“完成了”。这种端到端成功率只看最终目标是否实现,正好会暴露连续操作中小错误不断累积的问题。
难度上升后,成绩迅速下滑:简单任务成功率为 80.8%,中等任务为 52.9%,困难任务只剩 23.5%。据项目作者描述,单个应用内的操作大多还能完成;涉及连续使用三个应用时,Agent 容易反复点击、原地打转,最后耗尽步骤额度。
这不是偶发的小卡顿。该模型平均每项任务要走 29.25 步,耗时约 6 分钟,成本为 0.118 美元。换句话说,它不仅经常办不成,失败前还可能花掉不少时间和资源。
它最缺的也许是“开口问”
测试故意设置了 11 项“ASK USER”任务:完成任务所需的信息只在用户脑中,Agent 必须主动询问。其中 7 项只缺一个事实,4 项需要多轮澄清。模型全程仅主动询问两次,在后面这 4 项多轮任务里一次也没问。
后果很具体。项目作者称,有三项任务被模型自报为成功,设备状态复核却全部推翻:日历里两个活动时间重叠,模型却称没有冲突;它没有打开旅行时间信息;还有一次,本该询问用户姓名,却自行选了一个名字。
另有 7 项“幻觉控制”任务,测试数据被故意拿掉,正确做法是承认信息不存在。模型在其中 4 项里正确承认缺失,没有捏造答案。这个结果只适用于这组专设任务,但它说明可靠的 Agent 不只是要会行动,还要知道何时停手、何时求助。
常驻手机,还要过资源这一关
一次完整运行消耗了 69% 电量。峰值芯片温度达到 98.2℃;这不是机身表面接近 100℃,帖子记录的 power-amp/skin 温度为 48.9℃,电池温度为 37.9℃。这些指标把问题从“模型聪不聪明”推向了更现实的一层:即使操作能力继续提高,手机 Agent 若要长期常驻,也必须同时控制耗电、发热、耗时和调用成本。
作者称 56.7% 是当时榜单上最好的文本模式成绩。但供稿没有交代其余模型的版本、推理配置和完整比较范围,因此不能据此得出普遍的模型排名结论。更稳妥的解读是:即使在这次榜单领先的运行里,距离让人放心把手机交出去,仍有明显差距。
局限与未知
- 全部效果数据来自同一发布链,缺少独立复核;60 项任务的一次运行也不足以代表所有手机 Agent。
- “Qwen3.8-27b”与轨迹标识“qwen-28”存在命名不一致,正式确认模型版本仍需原始榜单说明。
- 现有材料没有披露任务顺序、步骤上限和其余模型配置,无法判断不同因素各自造成了多少失败。