Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.066 — 2026-09-08
NEWS 约 1 分钟

模型跑分终于能翻看原始答案

一套能逐题翻看模型原始回答的评测工具,让总分背后的失败方式真正可见。

IMAGE — r/LocalLLaMA 日榜

比较大模型,过去常像只看考试总分:你知道谁高几分,却不知道它错在知识、推理、格式,还是评分规则。lm-eval-ledger 是一套评测脚手架——自动运行题集、记录输出并计算指标的程序。它把结果写入 SQLite 数据库,再用网页逐题展示系统提示、模型回答、标准答案、停止原因等信息,还能并排比较两个模型。

这类细节会改变人们对排行榜的理解。作者在单张 5090 上测试三款模型时发现,Qwen3.5-9B 在 GPQA Diamond 得分最高,为 0.717,但耗时也最长;到了 LiveCodeBench,它耗时 22 小时 57 分,得分却最低,为 0.713。换句话说,“想得更久”并不总能换来更好结果。工具还会找出多次评测中始终答对或始终答错的题,方便开发者定位失败模式和版本退步。上述结果均来自作者自述,供稿未提供独立复核。


供稿材料 SOURCES — 1

← 返回 2026-09-08 · 开源板块