AREX Feed Article
CAIS 与 Scale AI 发布 HLE-Diamond:1,000 道精炼题,意在修复 HLE 榜单的噪声与污染
北京时间 9 月 23 日 23 时 51 分(UTC 15:51),Center for AI Safety(CAIS)在 X 官方账号宣布,与 Scale AI 联合发布 HLE-Diamond——经一年清洗、吸收多个研究社区意见后得到的精炼子集,详情发布在 。按 ,这次发布指向的是原榜单上的噪声与污染(noise and contamination)问题。
博客页同步给出数据集构成与首批成绩:HLE-Diamond 共 1,000 道题,其中 500 道 reasoning(推理)、500 道 knowledge(专家知识);无工具评测中,GPT-6 Astra 以 60.6% 排名第一,Claude Opus 5.5 为 55.0%。官方同时给出带 web+code 工具评测的推荐设置,数据集以 cais/hle-diamond 之名上线 。
HLE-Rolling 的反馈与防污染设计:1,000 道题从哪来
题目按「closed-book」(闭卷)设计——官方的说明是,这些问题应当能够在不借助外部资料的条件下作答。
博客致谢部分写道,HLE-Diamond 的成形离不开出题人、参与打磨的专家,以及在 HLE-Rolling 上提出意见的研究者——官方措辞是这些输入「塑造了」HLE-Diamond。HLE-Rolling 是 HLE 团队 2025 年 10 月 8 日上线的「动态分叉」版本,记录了这个节点;上线后的这一年里,研究者通过它滚动提交的反馈,构成了这次修剪的原料。
污染问题在 HLE 项目里早有对应机制。的说明写道,数据集内置 canary 字符串(BIG-bench canary 的超集),供模型开发者在训练前把基准数据从语料中过滤掉,页面还印着一行大写警示:基准数据绝不应出现在训练语料中。按官方「子集」的说法,1,000 题约为原题库的四成——官网时间线显示,HLE 于 2025 年 4 月 3 日定稿为 2,500 题。
数据集本身已经可以拉取: 是公开仓库,但需要先接受使用条件才能下载文件。
首批成绩:九个模型的无工具榜与八个模型的带工具榜
给出两张主表。无工具评测下,九个模型的成绩从高到低是:GPT-6 Astra 60.6%,Claude Opus 5.5 55.0%,Claude Fable 5.1 51.3%,Claude Opus 5 38.6%,Gemini 3.8 Flash 34.3%,GPT-6 Sol 33.8%,GPT-5.6 Sol 31.2%,Muse Spark 1.3 25.4%,Grok 4.7 23.4%。页面以厂商图标标注归属:三款 GPT 系模型挂 OpenAI 图标,三款 Claude 挂 Anthropic 图标,Gemini 与 Grok 分别挂 Google、xAI 图标。
分科目看,GPT-6 Astra 的推理题得分 75.6%、知识题 45.6%;Claude Opus 5.5 是 63.2% 与 46.8%——后者在知识题上反超 Astra 1.2 个百分点。
带工具对比表中列了八个模型,Grok 4.7 不在其中。加上网页检索与代码执行后,GPT-6 Astra 升至 82.9%,Claude Opus 5.5 升至 73.9%,Claude Fable 5.1 升至 72.4%;Astra 的两种设置相差 22.3 个百分点。
页面抓取版本在每张表下都标注「所有模型以 reasoning high(高推理档)评测」。这个口径发布当天就遭到质疑,团队当晚改了设置,见下文。
带工具怎么测:断网沙盒、两个网络工具和一份屏蔽名单
博客页链接的挂在 centerforaisafety/hle 仓库的 docs 目录下,把「web+code」设置写到了可复现的程度。
核心约束是断网沙盒:代码执行环境不许联网、不许下载文件或安装软件包,外部信息只能通过两个工具进入——web_search(query) 单次最多返回 20 条结果;web_fetch(url) 只返回网页或 PDF 正文转成的 Markdown,上限 60,000 字符,不返回图片、音频或视频。指南同时禁止挂载专用求解器、国际象棋引擎、OCR(光学字符识别)等任务库,运行环境固定为 Python 3.11.16 外加一组锁定的依赖。
防泄漏靠一份 :规则覆盖域名、URL 前缀、搜索结果页 URL 模式、大小写敏感与不敏感的正则,以及专门针对答案标题的匹配。搜索查询先查后发,结果按 URL、标题、摘要逐条过滤;取回的网页标题与正文要再过一遍规则,缓存响应同样要检;被拦截的调用连同命中的规则一起记入日志,供事后审计。
各模型跑在厂商自家的 agent harness(代理运行框架)里:Claude Fable 5.1 与 Claude Opus 5 用 Claude Code 2.1.278,Claude Opus 5.5 用 Claude Code 2.1.280,三款 GPT 用 Codex CLI 0.155.1,Gemini 3.8 Flash 用 Gemini CLI 0.60.0,Muse Spark 1.3 用 Muse Code 1.3.0。
Noam Brown 质疑评测口径,团队当晚换设置
公告发出不到一小时,评测口径:「你们的网站写着所有模型都以 reasoning high 评测。这个选择看起来很怪。」他的理由是:不同模型的 high 推理档差异极大;他建议直接报告评测的美元成本,「或者更进一步,给出准确率-美元曲线」。Brown 的 X 简介写明他在 OpenAI 从事推理研究,参与创建过 Libratus、CICERO 与 OpenAI o 系列推理模型。这条质疑获得 370 余个赞。
回应当晚陆续出现。18:24 UTC,X 简介自述 Scale AI 员工的 说:好主意,我们正在研究。21:42 UTC,——他的 X 简介自述为 CAIS 的 AI 安全研究员、HLE 创建者,lastexam.ai 官网组织团队名单里他排在首位——称主结果已更新为所有模型取 max(最高)档,并附上新表截图,补了一句「GPT-6 看起来很稳」。
Brown 没有就此收住:「max 推理档在不同模型之间差异同样很大!」()。但 22:02 UTC,他贴出网站新界面的截图,改口;22:23 UTC 又一次贴图:。对美元成本他仍留有余地:「理想情况是展示美元,但那个指标也有自己的问题。两个指标都不完美。至少是些东西。」()
截至北京时间 24 日上午核验时,公告帖发布约九小时,累计超过 5.8 万次浏览、600 余个赞。
从 Nature 论文到回复区的追问
要理解 Diamond 改的是什么,得回到 HLE 本身:官网记录,2026 年 1 月 28 日,HLE 刊登于 Nature 第 649 卷(1139~1146 页)——列出的作者为 Center for AI Safety、Scale AI 与 HLE Contributors Consortium,预印本编号 。
这个基准的立身之本是难。官网导语写道,LLM(大语言模型)在 MMLU 等旧基准上的准确率已超过 90%,基准难度跟不上模型;主页那张对比图显示,GPT-4o、o1、Claude Sonnet 3.5、Gemini 1.5 在 MMLU、MATH、GPQA 三项旧基准上多数超过 50%,在 HLE 上只有约 2%~9%。
仓库自带的评测示例输出与之相符:只有 3.07%,校准误差 92.3。
HLE-Diamond 是官方对这套题库的一次集中修剪,目标定在噪声与污染上。但发布当天,回复区的问题更具体:为什么成绩表里没有开源权重模型;数据集链接打不开,并追问这 1,000 题是原题的严格子集还是经过改写。修复效果目前只有发布方的口径——这 1,000 道题是否真的比原来干净、榜单是否更可比,要等第一批第三方复测出现才算数。