SWE-bench:AI编程能力测什么?
SWE-bench评估AI解决真实GitHub软件问题的能力,通过生成补丁修复开源Python项目中的bug,衡量模型在实际工程任务中的表现。
来源
FAQ - SWE-bench
verdent.ai
SWE-bench: Can Language Models Resolve Real-world Github Issues?
打开完整版