Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.063 — 2026-09-05
REPO 24 STARS 约 1 分钟

长任务编码Agent有了原创题考场

DeepSWE用113道原创工程题,检验编码Agent能否在真实项目里持续干活。

公开题库像一本流传已久的习题集:AI分数很高,可能是能力强,也可能早在训练材料里见过类似答案。DeepSWE想换一间更接近真实开发的考场。它从活跃的开源项目中设计了113项原创、长周期工程任务,覆盖TypeScript、Go、Python、JavaScript和Rust,考察编码Agent——能查看项目、修改文件并调用工具的AI——能否独立推进完整任务,而不只是补几行代码。

最值得注意的是它的判卷方式。Agent先在隔离环境中工作,完成后提交修改;系统再把这份修改应用到一个干净的容器——封装好程序与依赖的可复现环境——并运行隐藏测试。评分只看题目要求的外部行为是否正确,不要求代码结构或内部命名与参考答案一致;参考补丁也不参与判分。换句话说,它更像验收交付成果,而不是核对标准答案。项目仓库称,这套设置可用统一条件比较前沿编码Agent;但现有材料未提供各模型的具体成绩。


供稿材料 SOURCES — 1
01
datacurve-ai/deep-swe GitHub Trending(Python·日榜) · REPO
原文 ↗

← 返回 2026-09-05 · 开源板块