让 AI 写一份实验步骤不难,难的是让机器人真能照着做。少写一次加液、弄错设备顺序,纸面上的小疏漏就会变成无法执行的流程。这项研究把 LLM Agent——能拆解目标、调用工具并连续行动的大语言模型系统——接入机器人化学实验室,用真实设备约束检验它是否可靠。
研究团队把45个模块化工作站的操作整理成“机器可读技能”,相当于给 Agent 一份明确的工具菜单,并进行了4,608次试验。经专家评估,只有3.3%的试验生成了符合实验室约束、可以执行的工作流;即使表现最好的系统,也只有28.1%。更长的任务尤其棘手:可执行流程中仅3个超过30步,最长为44步。
更值得警惕的是纠错方式。论文作者称,在五轮实验中,反馈只促成了局部调整,没有带来整套流程的重新规划,也没有推动分析方法重做。换句话说,这些 Agent 会修补眼前一步,却还不会在证据表明路线有问题时真正换路。