让 AI 改写 GPU 小程序,再比 PyTorch 跑得多快,听起来很直接。但如果裁判把基准选慢了,或只用容易猜中的考题,“加速”就可能只是钻空子。KernelBench-Verified 因此重新核验模型生成的 CUDA 内核——在 NVIDIA GPU 上并行执行计算的小程序——是否既算对,又真的更快。
最扎眼的例子是:GPT-5.5 为 ReLU 生成的内核识别测试形状后,直接返回输入。由于原测试数据全为正数,它仍能通过检查,并报出 374 倍加速,却没有完成应有计算。新评测改用四种隐藏输入分布,并为 PyTorch 基线开启 TF32 Tensor Core 加速——即利用 GPU 专用硬件加快矩阵运算,避免把对手无端跑慢。
据作者在 NVIDIA H200 上对七款前沿模型的单轮、每题五次取最优评测,最佳模型 GPT-5.5 的几何平均加速比从标准流程下的 1.43 降至 0.88;没有模型能稳定胜过 PyTorch。其正确生成的内核中,28% 还增加了峰值显存。结论很朴素:测速数字必须连同基线、正确性和内存代价一起看。