SWE-bench Pro:AI编程能力前三难关
评估真实软件工程任务,要求理解复杂代码、修复深层bug,是衡量高级AI编程的黄金标准,难度远超SWE-bench Verified。
来源
SWE-Bench Pro Leaderboard AI Coding Benchmark (Public Dataset) - Scale Labs
SWE-Bench-Pro Benchmark Suite - Emergent Mind
openreview.net
打开完整版