Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.027 — 2026-07-31
PAPER 约 1 分钟

机器人化学实验室迎来压力测试

把LLM Agent接入机器人化学实验室后,最强系统也只有28.1%的流程真正可执行。

让 AI 写一份实验步骤不难,难的是让机器人真能照着做。少写一次加液、弄错设备顺序,纸面上的小疏漏就会变成无法执行的流程。这项研究把 LLM Agent——能拆解目标、调用工具并连续行动的大语言模型系统——接入机器人化学实验室,用真实设备约束检验它是否可靠。

研究团队把45个模块化工作站的操作整理成“机器可读技能”,相当于给 Agent 一份明确的工具菜单,并进行了4,608次试验。经专家评估,只有3.3%的试验生成了符合实验室约束、可以执行的工作流;即使表现最好的系统,也只有28.1%。更长的任务尤其棘手:可执行流程中仅3个超过30步,最长为44步。

更值得警惕的是纠错方式。论文作者称,在五轮实验中,反馈只促成了局部调整,没有带来整套流程的重新规划,也没有推动分析方法重做。换句话说,这些 Agent 会修补眼前一步,却还不会在证据表明路线有问题时真正换路。


供稿材料 SOURCES — 1

← 返回 2026-07-31 · 学术板块