给同一个模型做两次测试,结果未必一样;隔几天再测,差距还可能更大。ionutvi 团队因此不再把 Benchmark——用固定任务和规则比较模型能力的标准化测试——当作一次性考试,而是持续观察模型是否偏离自己的历史水平。这对使用 API 的开发者尤其重要:模型名称没变,实际服务的版本、配置或生成结果仍可能变化。
在覆盖 49 个模型的 31,352 次重复评分中,日内分数的标准差为 2.80 分,按日计算的中位数在不同日期之间则为 8.43 分,约是前者的三倍。换句话说,跨日变化明显大于同一天里的正常起伏。作者同时强调,这不能直接证明供应商每天都在更换模型;任务构成、抽样、数据缺失、服务状态和测试方法调整都可能干扰结果。
真正值得带走的是监控思路:选型时别只比较某天谁分数最高,上线后也要持续复测同一模型,并保存测试配置的版本。只有先摸清日常波动范围,开发者才更有机会判断一次降分究竟是随机噪声、服务故障,还是较稳定的性能漂移。