SWE-bench 评测基准
真实GitHub issue修复基准,评估模型解决实际软件工程问题的能力。
查看官方或原始资料评测方法与适用范围
SWE-bench是由Princeton University提出的软件工程基准,用于评估大模型解决真实世界GitHub issue的能力,是当前最具挑战性的代码工程基准之一。
评测方式
给定一个GitHub issue描述和相关代码仓库,要求模型生成补丁(patch)修复问题。通过运行仓库原有的单元测试(FAIL_TO_PASS和PASS_TO_PASS测试)评估补丁正确性,衡量模型在真实代码库中定位和修复bug的能力。
数据规模与来源
共2,294个任务,来源于12个流行Python开源项目(如Django、Flask、scikit-learn、matplotlib等)的真实GitHub issue和PR。每个任务都经过严格筛选,确保有明确的测试用例验证修复正确性。
业界地位
SWE-bench是评估AI智能体(Agent)软件工程能力的标杆基准,被OpenAI、Anthropic、Cognition等头部厂商广泛采用。它超越了简单的代码生成,要求模型具备代码理解、问题定位、多文件修改等综合能力,是衡量AI能否真正参与软件工程的关键指标。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。