Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.029 — 2026-08-02
NEWS 约 1 分钟

小型评测套件瞄准Agent外壳

smevals把模型、提示词和Agent外壳放进同一套可复现评测

IMAGE — Simon Willison's Weblog

选 AI 开发方案,不能只看模型排行榜。就像同一个人换了工作说明和工具箱,表现可能完全不同:提示词决定它收到什么指令,Agent harness——连接模型、文件、命令行和任务循环的程序外壳——则决定它能做什么、失败后如何重试。smevals想评测的,正是这套完整配置。

团队可用少量 YAML 文件定义任务和检查规则,再让多个配置执行同一套测试。这里的配置不只指定模型,也能更换系统提示词、模型参数或Agent harness。工具把“运行任务”和“按规则评分”分开记录,还能用本地网页或静态 HTML 查看结果。它的价值不在于给出一张通用榜单,而是让开发团队围绕自己的真实工作,快速重复实验,少凭一次演示或主观手感选型。供稿未披露具体性能对比结果。


供稿材料 SOURCES — 1

← 返回 2026-08-02 · 科技板块