选 AI 开发方案,不能只看模型排行榜。就像同一个人换了工作说明和工具箱,表现可能完全不同:提示词决定它收到什么指令,Agent harness——连接模型、文件、命令行和任务循环的程序外壳——则决定它能做什么、失败后如何重试。smevals想评测的,正是这套完整配置。
团队可用少量 YAML 文件定义任务和检查规则,再让多个配置执行同一套测试。这里的配置不只指定模型,也能更换系统提示词、模型参数或Agent harness。工具把“运行任务”和“按规则评分”分开记录,还能用本地网页或静态 HTML 查看结果。它的价值不在于给出一张通用榜单,而是让开发团队围绕自己的真实工作,快速重复实验,少凭一次演示或主观手感选型。供稿未披露具体性能对比结果。