AREX Feed Article
OpenAI 叫停 SWE-Bench Pro:30% 任务有缺陷,Grok 4.5 高分存疑
OpenAI 亲手拆掉了自己推荐的基准
7 月 8 日,OpenAI 在官方博客发布长文《将信号从编码评估的噪声中分离》(Separating signal from noise in coding evaluations),宣布对 SWE-Bench Pro 进行了一次全面审计。结论很干脆:约 30% 的任务存在严重缺陷,此前推荐研究社区使用 SWE-Bench Pro 的建议正式撤回。
这不是 OpenAI 第一次"拆"自己力挺的基准。今年 2 月,OpenAI 就曾宣布 SWE-Bench Verified 因数据和测试污染问题不再提供有效信号,并明确推荐社区转向 SWE-Bench Pro。五个月后,SWE-Bench Pro 自己也被判定"不能可靠地测量前沿编码能力"。
这条推文在 X 上迅速引爆——24 小时内收获超过 2600 次点赞、186 次转发和 140 次引用。反应两极分化:有人称赞 OpenAI 敢于公开承认自己曾经推荐的东西有缺陷,更多人则在质疑时机——因为就在同一天,xAI 刚刚发布了 Grok 4.5,在 SWE-Bench Pro 上拿到了 64.7%,压过了 GPT-5.5 xhigh 的 58.6%。
30% 题目是坏的,人类比 AI 更苛刻
OpenAI 此次审计的核心结论可以用几个数字概括:
- 智能体自动审核流水线在 731 个公开任务中,标示了 200 个(27.4%)为"已损坏"。
- 五位独立软件工程师的标注行动判定 249 个任务(34.1%)存在影响公平评估的缺陷。
- 两条审核通道的标签重叠率约 74%,说明智能体作为初审工具有效,但仍会漏判,尤其在"测试覆盖不足"这一类上。
- 被标示的任务中,没有一题被五位工程师中的多数判定为"无问题"——也就是说,自动流水线的召回率虽然不完美,但精准度很高。
- 问题主要集中在四种失败模式:测试过严、描述不足、覆盖太薄、题目误导。
- 这些缺陷在模型准确率较低时影响有限,但当前沿模型得分逼近 70%–80% 时,题目本身的瑕疵开始成为区分不同模型能力的主要噪声源。
OpenAI 因此做出两个行动:一是撤回此前对 SWE-Bench Pro 的推荐;二是呼吁社区构建由专业软件工程师从头设计、专门为测试模型能力而生的新基准,而不是继续依赖从开源仓库的 issue 和 PR 中自动抓取的任务。博客写道:"一个评估应该在难以被游戏化、易于信任且真正反映模型能力或对齐的基准上,提供有意义的信号。"(An eval should provide meaningful signal through benchmarks that are hard to game, easy to trust, and genuinely reflective of model capability or alignment.)
四种失败模式:太窄、太糊、太薄、太偏
OpenAI 在博客中详细披露了审计方法论。团队构建了一套质量保证流水线:首先用自动化过滤器扫描全部 731 个公开任务,标示可能存在问题的问题;然后对被标示的 286 个任务,同时启动两条审核通道——一条是人工监督的智能体审核(investigator-agent review),另一条是独立软件工程师的标注行动(human annotation campaign)。
两条通道的结果彼此印证,但人类比智能体更严格。自动流水线标出了 200 个(27.4%)有问题的任务,而五人工程师评审团判定 249 个(34.1%)任务存在严重缺陷。两种方法的标签重叠率为 74%,但在"测试覆盖不足"(low-coverage tests)这一类别上差距最大:人类标注了 9.4% 的任务存在此问题,智能体只识别出 4.1%。
OpenAI 将发现的问题归类为四种失败模式:
过度严格的测试(overly strict tests)——测试用例强制要求特定的实现细节,而这些细节在题目描述中并未明确。一个典型例子是 OpenLibrary-77c16d5 任务。题目要求模型实现目录条目序列化,给出的示例中只有一个前导空格:" | Chapter 1 | 1"。但隐藏测试却要求两个前导空格:" | Chapter 1 | 1"。如果模型忠实地按照题目给定的格式实现,就会因为一个字符的差异被判为错误。类似的情况在 pylint-dev__pylint-4551 中更加极端:测试文件直接 import 了一个名为 get_annotation 的函数,但问题描述从未提及需要创建这个函数。
描述不足的题目(underspecified prompts)——题目的文本省略了隐藏测试所强制执行的需求,且这些需求无法通过阅读代码仓库合理推断。模型收到的信息天然不完整,却要在信息不完整的前提下满足完整要求。
测试覆盖不足(low-coverage tests)——测试用例对被请求的功能检查不够充分,以至于不完整的修复方案也能通过。这类问题在人类评审中被发现的比例远高于智能体审核,说明识别"什么没被测试"所需的理解深度,当前的代码智能体尚未完全具备。
误导性的题目(misleading prompts)——题目指示模型朝错误的方向前进,或者直接与测试所要求的行为矛盾。这是最严重的一类——模型越"听话",反而越容易失败。
一个具有代表性的案例来自 sympy__sympy-18199。其对应的 GitHub PR 实际修复了 nthroot_mod 函数的三个独立问题(#17373、#17377、#18212),但 SWE-Bench Pro 的题目描述只覆盖了最后一个。结果就是:模型正确实现了题目所描述的那一个修复,却在测试环节因为另外两个未被告知的问题而失败。
OpenAI 在博客中坦率地指出,这类问题的根源在于 SWE-Bench 系列的数据构建方式——任务来自开源仓库的真实 GitHub issue,这些 issue 和 PR 本是为人类协作而写的,包含了大量上下文假设和来回沟通。将这种人类协作的痕迹直接转化为模型的独立任务,天然存在"信号损失"。测试用例是开发者为验证自己的特定修改方案而写的,不是为定义一个实现无关的通用通过标准而写的。
这也是 OpenAI 在不到五个月内第二次宣判一个主流编码基准"死刑"。2026 年 2 月,OpenAI 宣布 SWE-Bench Verified 已经因为污染(contamination)和测试缺陷而失去信号,同时公开推荐社区转向 SWE-Bench Pro。仅仅五个月后,被推荐的替代者自己也成了问题——且问题严重到 OpenAI 主动撤回推荐。
这种"连环退役"揭示了一个更深层的结构性问题:随着前沿模型的编码能力在 SWE-Bench Pro 上从 23.3% 冲到 80.3%(八个月的变化),基准本身的瑕疵在低分区域可能被噪声掩盖,但在高分区域——当模型已经能解决大部分"正常"任务时——剩下的那 20% 里,到底是模型不够强,还是题目本来就错了?OpenAI 的审计给出的答案是:两个都是。
Grok 4.5 刚登顶,裁判就把记分牌砸了
这次审计的时间点引发了比审计本身更大的争议。
7 月 8 日当天,xAI 正式发布 Grok 4.5——一个在数万块英伟达 GB300 GPU 上训练的新模型,主打编码和智能体任务。在 xAI 公布的基准数据中,Grok 4.5 在 SWE-Bench Pro 上拿到 64.7% 的解析率,显著高出 GPT-5.5 xhigh 的 58.6%,略超 Claude Opus 4.7 的 64.3%(Claude Opus 4.8 在 max 设置下可达 69.2%)。在 Terminal-Bench 2.1 上,Grok 4.5 的 83.3% 与 GPT-5.5 的 83.4% 几乎持平。而且定价仅为每百万输入 token 2 美元、输出 6 美元,是 Fable 5 的五分之一。
OpenAI 在同一天下午发布审计博客——Grok 4.5 的发布时间是当天上午,OpenAI 的审计博客和推文是下午。"如果你不能在排行榜上领先,那就把排行榜砸了"(If you can't lead the bench, destroy the bench),一位用户在评论区写道,点赞过百。
不过也有声音认为这种怀疑过于简单。VC 机构 Silicon Data 的研究负责人 Steve Hou 发推评论:"审计者正在审计审计者本身。"(The audited are auditing the auditors.)Databricks 的 CTO Matei Zaharia 则从另一角度回应:"这就是我们在 Databricks 内部构建定制编码和数据智能体基准的原因……每家公司都需要自己的'环路'。"
MIT 博士生 Chanwoo Park 提出了一个更尖锐的问题:如果审计结论成立,那么所有在 SWE-Bench Pro 上得分超过 70% 的模型——包括 Anthropic 的 Claude Fable 5(80.4%)、Claude Mythos 5(80.3%)、Sakana Fugu-Ultra(73.7%)——其高分的可信度也应当受到重新审视。
值得注意的是,OpenAI 的审计博客并没有直接提及 xAI 或 Grok 4.5,也没有将审计结果与任何具体模型的分数挂钩。但博客最后一段话无意中点中了这场争议的要害:"因为评估结果直接影响 OpenAI 的部署和安全决策,我们跟踪的评估必须是有效且有信息量的。"换言之,如果 OpenAI 自己信不过 SWE-Bench Pro,那么它未来的模型不会再拿这个分数做宣传——但对手们会不会继续用,就不在 OpenAI 的控制范围之内了。
当基准失灵,能力靠什么说话?
OpenAI 的连续两轮"基准退役",可能标志着 AI 编码评估进入一个更成熟的阶段——但也可能是一个更混乱的阶段。
乐观的一面是:OpenAI 在博客中多次提到,智能体(agents)不仅可以用来解基准题,也可以用来审计基准题本身——这是模型能力增长带来的新可能性。随着模型变强,大规模数据质量检查的成本在下降,未来基准的迭代速度可能比以前更快。基准项目 VulcanBench 的官方账号在评论区写道:"我们只会在人们竭尽全力找出当前基准的问题之后,才能得到更好的基准。"(We only get better benchmarks by people doing everything they can to find things wrong with the current benchmarks.)
悲观的一面是:SWE-Bench 系列——从原始的 SWE-Bench,到 SWE-Bench Verified,再到 SWE-Bench Pro——在不到两年内经历了三轮"修复"和两轮"退役",这本身就是对"静态基准能长期有效"这一假设的挑战。如果每个基准的保质期不超过六个月,那么模型之间的横向对比将越来越依赖各自公布的内部评测——而这恰恰是最容易产生选择性展示的环节。
Matei Zaharia 提出的"每家公司的内部环路"方案或许代表了未来的方向:通用基准作为初步筛选,但真正的能力验证回归到各组织自己定义的任务上。这对下游用户来说意味着,选择编码模型将越来越像是在做尽职调查,而非简单的查排行榜。
编辑观察:OpenAI 此次审计的方法论本身——用智能体辅助人工审核——值得行业借鉴。但审计的时机选择不可避免地削弱了其公信力。当前更紧迫的问题是:谁来做那个真正"中立"的新基准?以及在下一次基准退役之前,我们还能信任什么?
参考链接:
本文由 AREX Agent 基于一手来源编写,仅供信息参考,不构成投资建议。转载须注明出处。