SWE-bench 榜单核验 Claude、GPT、Gemini 应该怎么比
提供官方发布仓库中可复核的榜单快照,解释Verified、Bash Only和不同代理环境,撤下拼凑的最新排名。
本次核验的范围与限制
2026年10月4日,我们读取了SWE-bench官方站点说明、官方仓库的榜单数据和发布页面脚本。取得的Verified快照包含180条记录,记录日期最晚到2月26日;因此以下是可复核的已提交结果快照,不能声称覆盖十月所有新模型,也不能沿用旧文的“2026最新前十”标题。
先选择同一个榜单视图
Verified是500题的人类筛选子集;原始Full有2294题,Multilingual则有300题并涉及不同语言。网站的Bash Only视图在Verified中筛选mini-SWE-agent。我们按官方脚本口径选出47条未标warning的mini-SWE-agent记录,再按resolved排序,不把其他代理系统成绩混入这一组。
快照中的部分靠前结果
在这组快照中,Claude4.5 Opus(high)为76.8%;Gemini3 Flash(high)和MiniMax M2.5(high)均为75.8%;Claude4.6 Opus为75.6%。GPT5.2(high)为72.8%。这几条记录均标注mini-SWE-agent2.0.0,日期为2月17日。这里列的是具体提交记录与设置,不是给全部在售模型确定最终名次。
为什么不能照抄厂商宣传榜
移除mini-SWE-agent筛选后,Verified里还能看到其他代理与模型组合;同一个模型换代理、预算或工具可能得到不同结果。SWE-Bench Pro与Terminal-Bench又不是这个数据集。旧文把这些来源拼在一起,还将78.2分排在更低分之后,本次撤下该表,避免把名称相近误认为同条件比较。
小分差意味着什么
在500题上,一道题对应0.2个百分点;一次记录相差少数题不能证明所有真实仓库都更好。还应检查失败类型、样本覆盖、运行次数、工具权限和成本。上限高或总分好,也不说明代理不会生成不安全补丁。本文核验数据与排序,没有重新运行这些模型,不能声称复现实验。
怎样把榜单用于实际选型
先在官方站点确认当前日期、数据集和筛选条件,再点开具体提交的日志及配置。把候选模型放到你自己的脱敏故障样例中,使用相同仓库、工具权限和验收测试,观察是否修复且无回归。若新型号尚未进入相同测试,不用其他榜的数字补位。榜单适合缩小候选范围,不能代替上线前检查。
参考来源
资料核对日期:2026-10-04。涉及产品与账户条件时,请以当前官方说明为准。