让数据科学Agent训练一个模型,就像让人尝试一道耗时几小时的菜:如果每次都做完才发现路线不对,成本很快失控。DSWorld要解决的正是这种反复试错。它给Agent加入“世界模型”——一个在脑中预演操作结果的系统,让Agent在真正运行前,先估计数据、模型、报错和性能信号可能发生什么变化。
它最实用的一点,是不把所有操作都交给模型猜。DSWorld先整理任务、数据概况、运行记录和错误信息,再由路由器判断操作成本:检查环境、简单处理数据等轻量动作直接执行;大规模模型训练等昂贵动作,则交给基于LLM的模拟器预测下一状态。换句话说,便宜的步骤求准确,昂贵的步骤先推演。作者还构建了约8000条数据科学Agent轨迹用于训练,并称DSWorld在状态转移预测任务上平均超过最强LLM基线35.6%。论文也报告训练和搜索推理得到加速,但当前抓取文本缺失具体倍数,因此不宜据此判断实际节省幅度。