Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.080 — 2026-09-22
PAPER HF 12 约 1 分钟

一个视觉Agent横跨三类屏幕

MintAct用同一视觉模型操作手机、桌面和网页,尝试让电脑Agent告别平台专用模型。

让 AI 替你在手机上改设置、到电脑里整理文件,再去网页提交表单,今天往往要换三套“专才”。MintAct 想把它们合成一个模型:它直接读取截图和文字指令,判断该点哪里、输入什么,并在每一步操作后继续决策。值得关注的是,它统一的不只是三类屏幕,还包括 UI grounding——把“点开设置”准确对应到按钮和坐标——以及需要连续操作的多步导航。

难点在训练:手机、桌面和网页的操作方式不同,简单混合数据容易彼此干扰。MintAct 先分别用各领域的强化学习训练“专才”,再把能力汇回同一模型,最后联合优化;其异步训练系统还会控制各平台的数据比例,避免响应更快的平台占据训练。作者称,8B 版本在桌面任务基准 OSWorld-Verified 得到 48.9,并在相近规模下匹配或超过各领域专用模型。这个结果说明,统一接口未必必须牺牲单个平台的表现,不过目前证据仍来自论文作者的基准测试。


供稿材料 SOURCES — 1

← 返回 2026-09-22 · 学术板块