Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
NEWS 约 1 分钟

多语言编码榜开始补齐真实世界

SWE-rebench加入五种语言的真实任务,开始检验编码模型能否应付不同技术栈。

IMAGE — r/LocalLLaMA 日榜

让编码模型修一个 Python 项目,和让它接手一家公司的整套代码库,不是一回事:现实团队还会用 Go、Java、Rust 和 TypeScript,各自有不同的构建、依赖与测试工具。SWE-rebench 此次把评测扩展到五种语言的真实软件工程任务,让模型在代码仓库里修复问题,再由测试判断是否成功。它比生成一小段孤立代码,更接近日常维护工作。

这次最值得看的,是“第一次做对”和“多试几次做对”之间的距离。发布者给出的榜单中,GLM-5.2 的 Pass@1 为 62.9%,即首次尝试通过的比例;Pass@5 为 81.1%,即最多尝试五次后至少成功一次的比例。DeepSeek-V4 Pro 两项分别为 40.2% 和 64.0%,Qwen3.6-27B 则为 31.2% 和 57.7%。这说明榜单不仅在比较模型会不会写代码,也在观察一次交付是否可靠。上述数据来自项目发布者,材料未披露各语言的任务数量与分项成绩,因此暂时不能判断模型具体在哪种语言上更强。


供稿材料 SOURCES — 1

← 返回 2026-07-30 · 开源板块