AREX Feed Article
Epoch AI 推出 Benchmark Reviews:首批 15 个 AI 基准,9 个被判 Flawed
9 月 17 日 21 时 53 分(UTC,北京时间 9 月 18 日凌晨 5 时 53 分),AI 研究机构 Epoch AI(@EpochAIResearch)在 X 上推出 Benchmark Reviews(基准评审)——一项专门审计 AI 基准的新计划。帖文写道:“推出 Benchmark Reviews:我们审计 AI 基准的新计划。首批覆盖 15 个基准:4 个 Verified(经核实),9 个 Flawed(存在缺陷),另有 2 个因信息不足无法评审。”3 秒后,该机构在中给出链接。截至 9 月 19 日检索,宣布帖已获得 1,824 个点赞、550,855 次浏览。
被判 Flawed 的 9 个基准包括用于衡量模型编程能力的 SWE-bench Verified、通过公众征集题目构成的 Humanity's Last Exam,以及 Berkeley Function Calling Leaderboard(BFCL)v4、HealthBench Professional 等。给出了具体数字:随机抽查的 48 道题里,22 道(46%)存在足以改变得分准确性的错误。这些判定均出自 Epoch AI 自己的评审。
首批 15 个基准的完整名单
按 Epoch AI 在 中公布的名单,15 个基准的判定与评审日期如下:
| 基准 | 判定 | 评审日期 |
|---|---|---|
| ExploitBench v0.1 | Verified | 9 月 12 日 |
| CritPt | 信息不足 | 9 月 11 日 |
| FrontierCode | 信息不足 | 9 月 11 日 |
| Berkeley Function Calling Leaderboard (BFCL) v4 | Flawed | 9 月 10 日 |
| HealthBench Professional | Flawed | 9 月 10 日 |
| SimpleQA Verified | Verified | 9 月 10 日 |
| PostTrainBench v1.1 | Verified | 9 月 9 日 |
| DeepSWE v1.1 | Flawed | 9 月 7 日 |
| Terminal-Bench 4.0.0 | Flawed | 9 月 4 日 |
| SWE-bench Verified | Flawed | 9 月 3 日 |
| SWE-Bench Pro | Flawed | 9 月 1 日 |
| Humanity's Last Exam | Flawed | 8 月 11 日 |
| Lech Mazur Writing | Flawed | 8 月 10 日 |
| TextQuests | Flawed | 8 月 10 日 |
| WeirdML v2 | Verified | 8 月 10 日 |
表中的评审日期从 8 月 10 日排到 9 月 12 日。文档同时说明,首批刻意在错误类型与领域上选取有代表性的样本;需要领域专家知识的基准要等 Epoch 外聘专家,耗时更长。
抽 50 道题、错误率过 20% 即判 Flawed
把结论分成三档:可审查性(Reviewability)达到 Full 或 Partial、且没有任何影响得分的缺陷越过质量阈值,记为 Verified;可审查性达标但至少一项越线,记为 Flawed;所需信息不可得,只能记为 Not enough information(信息不足)。
抽样规则是:任务多于 50 个的基准随机抽 50 道(有分类时按类别分层);观测错误率落在 15%~25% 之间时扩到 100 道;任务不超过 50 个的全部核查。四类“一票否决”项分别是:Scoring(评分:抽检样本中 20% 以上存在错误,或某个问题会成规模损坏判分)、Benchmark Consistency(榜单混入不同版本的不可比结果)、Elicitation(引导设置严重压低模型表现)、Bias in Evaluation Setup(评测设置给特定模型实质性优势)。另有一组“希望达标但不一票否决”的质量项,包括数据污染风险、人类可完成性,以及每个模型至少跑 5 次以给出误差区间的统计建议。
每份评审对应基准的一个固定快照:开发者发布修复错误的新版本后可以请求复审,但已发布版本的标签不会改变。
Humanity's Last Exam:12 道题按题面无法作答
评审页记录的抽查方法是:随机抽取 48 道题——8 个类别各 6 道——先让模型 Fable 5 标记疑点,再逐题人工确认,剔除不达证据门槛的发现。结果是:12 道题按题面无法正确作答,原因包括从未告知模型的关键前提、自相矛盾的前提、多种有效解读,以及要求对主观问题给出客观答案;另有 10 道题可能把正确答案判错,其中 5 道同时可能把错误答案判对。
评审页列出的代表性错误包括:一道计算机题要求对 4 个样本做 4 点 DFT(离散傅里叶变换),给出的序列却有 8 项;一道工程题中,出题者自己的解析指向选项 E,答案键却写着 D;一道人文题只认 “1kin” 这个缩写,同样常用的 “1kgs” 会被判错;一道数学题的解析算出归一化常数 1/21.3535,答案键却写着 21.35。
SWE-bench Verified 被判 Flawed:评审援引 OpenAI 与 RDI 的审计
SWE-bench Verified 从原始 SWE-bench 的 2,294 道题中经 3 名专家独立复核筛出 500 道题,任务取自 12 个公开 GitHub 仓库的真实软件问题,要求模型生成修复补丁。没有重做这类检查,而是援引已发表的审计结果。
OpenAI 在 2026 年 2 月 23 日发布的审计覆盖了 27.6% 的任务,其中 59.4% 的测试用例会拒绝功能正确的提交,折算下来全部任务中至少 16.4% 已损坏。Epoch 据此判断,该基准不太可能满足其“影响准确性的题目少于 20%”的 Verified 门槛。OpenAI 的分析还发现,所有受测的前沿模型都在训练中见过部分题目与答案,其结论是:在该基准上的进步已不再反映模型真实软件开发能力的实质提升,而越来越多地反映模型在训练时接触了多少基准内容。RDI 则找到了一个能拿满分的 reward hack(利用奖励机制漏洞的作弊手段)。截至 9 月 3 日评审日,该基准 100% 的任务与解答都是公开的。
一天预警期、不审自家基准,以及第一波争议
Epoch 在 中解释了做这件事的理由:基准是公开评估 AI 能力的主要方式,但“至今没有做过系统性的质量检查”,而已有的基准审计屡屡发现大量错误——文档脚注提到,Epoch 早前对 FrontierMath v1 的审计发现 42% 的题目存在错误。Epoch 还提到两类系统性问题:其一,环境层面的缺陷正引发 reward hacking 行为,波及多个基准,尤其是 agentic(智能体)基准;其二,脚手架(scaffold,运行评测时的框架设置)的差异——Epoch 引用自己此前的分析估计,更换脚手架最高会给 GPT-5 带来 11% 的成绩差异,给 Kimi K2 Thinking 带来 15% 的差异。
按文档的说法,这项计划有三个目标:告知公众基准质量、激励开发者做出高质量基准、沉淀“如何做好基准”的知识。后续选题按影响力(Impact)、触达面(Reach)和多样性(Diversity)排序;对向评审者开放了私有信息的基准,评审只披露不含题目级分析的通用信息,以避免泄漏。Epoch 还说明:出于利益冲突,不评审自家基准——“这不代表我们认为我们的基准没有错误”——未来可能委托外部评审;评审一般不收费,例外会明确注明。
流程上,Epoch 承诺至少提前一天通知开发者,只要对方愿意就全文刊登其回应;不认可结论的开发者可以致信 。这套规矩没有挡住所有质疑。沃顿商学院教授 Ethan Mollick :“Epoch 一直在做这个领域最好的公开基准评测工作之一。这很有帮助(也让我们看到基准评测的现状有多糟,以及我们最喜欢的一些基准有多糟糕)。”研究者 Jerome Wynne 则:“审查评测的缺陷是慷慨之举,但以这种方式对志愿者无偿贡献的工作直接下结论——看起来事先并未联系作者——似乎具有挑衅性,且适得其反。”
对被判 Flawed 的基准,评审是“部分评审”:一旦发现足以支撑结论的错误,Epoch 就停止检查、直接发布,不做全面审查——按其 FAQ 的说法,这意味着报出来的错误是下限,而不是全部。