Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.089 — 2026-10-01
PAPER H 2 约 1 分钟

AI基准测试也需要一种可执行语言

Benchy把任务、数据和评分写成可执行规范,减少AI评测中的实现偏差。

同一道考试,如果每位监考人都按自己的理解发题、判卷,最后的排名很难说明谁更强。AI基准测试也有这个问题:任务说明、数据处理和评分脚本常纠缠在一起,榜单差异可能来自实现细节。Benchy试图把整套规则变成机器可执行的统一规范。

评测作者用规范化的YAML——一种便于人阅读的配置格式——明确写出程序的输入输出、数据集和评分函数,再确定性地编译成统一的JSON中间表示,交给同一引擎执行。编译只转换格式,不修补错误,也不暗中加入默认值。外部AI系统则通过适配器接入统一接口,避免各家的调用方式渗入评测定义。

最具体的一点是:输出中的每个末级字段都会成为评分维度,并且必须显式设置权重。例如发票抽取可让“总额”比“供应商”更重要;当前版本按完全一致与否计0或1,再计算加权平均。它的价值首先是把“考什么、怎么判”说死并留档。论文主要给出语言与首版引擎的工程规范,尚未披露跨系统复现实验。


供稿材料 SOURCES — 1

← 返回 2026-10-01 · 数据板块