Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.085 — 2026-09-27
PAPER 约 1 分钟

长任务奖励开始按进度分账

ProCredit把终点成败拆到每一步,让长任务中真正推进目标的操作获得奖励。

让 AI 调整闹钟:提前起床闹钟,再关闭其他闹钟。它做了十几步,最后却漏关一个。传统训练只记“失败”,既看不出它已经完成大半,也不知道哪些操作有效。ProCredit要解决的正是这种长任务里的信用分配——把最终结果合理归因到沿途每个决定。

它利用任务原有的验收检查:训练时,每次工具调用后都重新检查环境,计算已通过项目的比例;比例上升的那一步得正奖励,破坏成果得负奖励,只查询、不改变结果则得零。这样,即使一组尝试全部失败,模型仍能比较谁更接近完成;也不需要另训一个奖励模型来猜测中间表现。

作者称,在AppWorld上训练三种规模的Qwen3.5基础模型后,ProCredit在两个测试集、所有规模上都取得最高任务完成率;4B模型比最强的终点奖励基线高4.1个百分点。更关键的消融实验显示,只把最终进度加进整条轨迹的总分并无改善:收益来自把进度准确记到它发生的那一步。


供稿材料 SOURCES — 1

← 返回 2026-09-27 · 学术板块