Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.071 — 2026-09-13
NEWS 2 信源 约 1 分钟

Agent运行时也需要统一跑分

模型分数只测“大脑”,两则讨论呼吁给Agent整套执行系统统一跑分。

你让两个Agent处理同一份任务,即使它们使用同一个模型,结果也可能不同:一个会在工具报错后重试,另一个可能原地卡住。差别来自Agent runtime,也叫harness——包在模型外面的执行框架,负责规划循环、整理上下文、调用工具、重试和保存状态。两则LocalLLaMA讨论认为,只看模型跑分,已经不足以解释Agent为何成功或失败。

用户Balance-提出,应把不同平台放进同一套端到端基准:让系统完整执行真实任务,再比较成功率、每次成功的成本、耗时、工具调用与重试次数、长任务可靠性,以及是否需要人工介入。关键是做可控变量实验:固定模型只换harness,再固定harness只换模型,才能看清差距究竟来自哪一层。

另一位用户Background-Job-862进一步主张同时开放模型与harness,以便调整上下文、工具执行、停止条件和状态维护。这些仍是社区提议,材料未给出已落地的统一基准或实测结果;但问题很明确:今后要比较的,不只是AI的“大脑”,还有它把事情做完的整套工作机制。


供稿材料 SOURCES — 2

← 返回 2026-09-13 · 开源板块