你让助手查一道需要拼接多份资料的问题。固定流程像一次性把一摞材料摆上桌:漏掉关键一页,后面再会推理也没用。Agent 则像一名会回头补资料的助理,读到线索断了,就换个方向继续搜。PipesHub 团队用 Google 的 FRAMES 基准比较了这两条路线,想回答一个很实际的问题:混合检索、重排和查询扩展这些常见组件,真的比“边读边搜”更有效吗?
先说明证据边界:实验成绩、成本数据和实现细节均来自 PipesHub 团队自己的公开说明,尚无独立结果确认;作者也披露自己任职于该开源项目。
18套流水线,输给一次次回头找
RAG,即“检索增强生成”,会先从文档库找资料,再让模型依据这些资料回答。固定 RAG 流水线会预先规定检索步骤,例如先做混合检索——同时寻找字面相同和语义相近的内容——再用重排模型重新判断相关性,把更重要的材料放到前面。
PipesHub 称,他们保持回答模型、向量表示模型和文档不变,只调整 RAG 流程,共测试了18种组合。任务来自 FRAMES:一套考查检索、事实判断与推理的多跳问答基准。所谓“多跳”,就是答案不在单独一段文字里,系统必须把散落在几处的信息串起来。
按团队公布的结果,最佳固定流水线的端到端答案准确率为78.9%。可读取检索结果、发现缺口后再次搜索的 Agent loop 达到92.7%。这里的“端到端”很重要:它衡量最终答案是否正确,不只是搜索结果看起来是否相关。团队还称,Agent 的成绩大致追平了预先把正确文章交给模型的理想化条件,但没有公布后者的精确分数、误差范围或显著性检验。
这个差距指向的未必是“Agent 天生更聪明”,而可能是流程能否根据途中发现及时改道。固定流水线像出门前写好的采购单;Agent 看见缺货后,还会决定去下一家店。对需要多次拼接证据的题目,这种反馈能力尤其有利。
重排不是装上就会变好
结果里最反直觉的一项来自重排。重排会让另一个模型检查初步搜出的材料,决定哪些内容优先进入有限的上下文。它常被视为高质量 RAG 的标准部件,但 PipesHub 称,一个小型重排模型让最佳流水线的准确率下降约9个百分点,更大的重排模型也只带来很小改善。
这不能证明重排普遍无用。它只说明,在这批多跳问题和这些具体组合中,相关性判断可能会提前丢掉后续推理所需的弱线索。就像整理案卷时,一张单看不起眼的票据,可能正是连接两段事实的桥。由于团队没有给出“大模型仅小幅改善”的精确分数,结论仍应保持克制。
引用很多,也可能没有证据
团队还发现一种更隐蔽的“正确”:检索材料缺少答案时,模型有时会用训练中记住的信息补齐,并附上看似完整的引用。最终文字答对了,却不能算检索成功。
据 PipesHub 在 Reddit 和 GitHub 的公开说明,研究者因此逐条核对正确答案与系统实际读取的文本;答案若来自模型记忆,就不计为 retrieval win,也就是“检索命中”。评分则沿用 FRAMES 论文的提示词,由 Claude Sonnet 5 和 Gemini Flash 3.8 两个 LLM judge——负责自动判卷的大模型——独立判断。团队报告两者的 Cohen’s κ 为0.93至0.98。这个指标衡量两名裁判的一致程度;高一致性说明它们很少互相冲突,但不等于判分一定正确。
高分后面拖着成本尾巴
Agent 的优势并非免费。PipesHub 公布的补充数据称,Agent loop 平均每题成本约为最佳固定流水线的三倍,最慢5%的请求延迟也明显更长;最贵的10%题目消耗了43%的总支出。一次早期测试中,朴素循环甚至对同一道题搜索50次,耗尽15轮仍未作答,团队后来加入完成检查和“没找到就继续找”的提示。
所以,这次测试更像是在揭示一种工程交换:固定流水线便宜、路径可控,却可能在第一次漏检后无力补救;Agent 能把更多计算集中到难题上,换来更高准确率,也带来更难预测的费用与等待时间。
为什么值得关注
真正值得看的,不是“RAG 已经过时”,而是常见组件不应只凭惯例堆叠。混合检索、重排和查询扩展各有合理直觉,但端到端测试可能给出不同答案。尤其在多跳任务里,系统能否察觉证据缺口并重新搜索,可能比一次把检索顺序排得更漂亮更关键。
这也提醒团队分开看三件事:答案是否正确、证据是否真的被读取,以及取得答案花了多少资源。只盯最终准确率,会把模型记忆误算成检索能力;只看检索分数,又可能忽略模型是否真正完成了推理。
局限与未知
- PipesHub 称实验覆盖 FRAMES 全部824题,但独立复现实验曾因链接文章缺失只评估822题。数据快照、失效页面和实际有效样本数仍需澄清。
- 78.9%、92.7%、重排下降约9个百分点及裁判一致性均来自同一机构,尚缺独立复现;自动裁判的具体版本、采样设置、分歧处理和人工复核细节也未获独立确认。
- 这项比较只涉及一个特定 Agent loop、18套特定流水线和多跳检索任务。它不能推出 Agent 在简单查询、成本、延迟或生产可靠性上全面胜过固定 RAG。