SWE-bench Pro:AI编程能力前三难关

评估真实软件工程任务,要求理解复杂代码、修复深层bug,是衡量高级AI编程的黄金标准,难度远超SWE-bench Verified。

来源

打开完整版