Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.091 — 2026-10-03
PAPER 约 1 分钟

LLM流水线会在接口处丢掉40分

同一模型和提示,任务一拆多步,接口漏信息就可能让准确率骤降40.5个百分点。

像多人接力解题:每个人都认真,但前一位只转述了数字,漏掉“谁比谁多”之类的关系,后面的人就可能算错。研究者把这种仅由阶段交接造成的损失称为“分解税”。他们固定模型、题目、各阶段提示和输出预算,只改变后续阶段能否重新看到原题,以单独衡量接口损耗。

在 MATH-500——一组较难的竞赛式数学题——上,gemma-3-12B 的四阶段流水线若后续只能看上一阶段的输出,准确率为 15.0%;让每阶段同时看到原题后升至 55.5%,相差 40.5 个百分点。这个结果经过 Holm 多重比较校正后仍显著。论文还发现,若要求负责整理信息的阶段保留数字之间的全部关系,9 个模型的损失都下降。

作者因此建议:先逐段测出哪个接口漏信息,再让它后面的阶段重新读取原题,而不是只检查每个模块单独表现。不过这些结论来自 GSM-Hard 与 MATH-500、每个实验单元 200 道题的测试,能否推广到其他任务仍需验证。


供稿材料 SOURCES — 1

← 返回 2026-10-03 · 学术板块