AREX Feed Article
Redwood Research 与 Anthropic 发布概念推理指数:Opus 5 得 73.6 分,天花板约 91
8 月 12 日,Redwood Research 与 Anthropic (Conceptual Reasoning Index,CRI),把 LMCA、ACCoRD、DTBench 三个基准合成一个 0–100 的分数,专门衡量模型对无法实证验证的问题的推理能力。目前得分最高的是 Claude Opus 5:73.6(95% CI ±2.1),作者估计这套指数的天花板约为 91。
自 2024 年底以来,各实验室旗舰模型的 CRI 分数大致线性上升,没有放缓迹象。分项看并不均匀:DTBench 已经逼近满分,Claude Fable 5 答对 98% 的题;LMCA 仍明显低于其天花板,作者粗略估计它约一年后开始饱和。
三个基准合成一个分数
CRI 目前是三个基准的加权平均:LMCA 占 60%,ACCoRD 占 20%,DTBench capabilities 占 20%。分数从 0 到 100,0 对应随机猜测,100 对应各基准的最高可能得分。榜单数据截至 2026 年 8 月 10 日,所有模型都以最大 token 限制和 effort 水平运行。
发布页面的六位作者中,Emery Cooper、Caspar Oesterheld、Chi Nguyen、Alex Kastner 来自 Redwood Research,Joe Benton、Ethan Perez 来自 Anthropic,正文注明"这项工作与 Anthropic 合作完成"。计算 Fable 5 的分数时,遇到它拒答的题目就改用 Opus 5 的回答兜底。
实时分数和完整方法说明放在 ,LMCA 数据集通过申请表单开放。
为什么专考"查不到答案"的题
这套指数的出发点是当前训练的一条规律:模型训练依赖海量数据和可靠反馈信号,所以在无法用经验或数学验证的任务上普遍更弱。而降低先进 AI 风险的工作里,这类任务到处都有。
第一类是对比人类更强的 AI 做推理,没有现成的参照类;第二类只能一次做对,比如失误导致 AGI 接管或 AI 协助的政变,可能来不及纠错;第三类时间跨度极长,例如优先做哪个研究议程、采纳哪项治理措施;第四类没有标准答案,比如 AI 应当持有什么价值观。
作者把这些场景命名为概念推理(conceptual reasoning):经验证据有限、没有实际可验证的答案、必须依赖论证。脚注引用 METR 今年 2 月至 3 月的 Frontier Risk Report,其中称 agents 的判断力和可靠性明显差于人类专家,但在"进展廉价可验证"的问题上异常强。
LMCA 看论证,ACCoRD 看自洽,DTBench 看决策论
LMCA(Language Model Conceptual Argumentation)含 560 篇立场文本和 1,461 条反驳论证,共 2,140 条评分,几乎全部由 Emery Cooper 打出。评分依据一份详细 rubric;约 50 条论证的验证集由 4–6 人各自独立评分,再总共讨论 7–8 小时。
目前计入 CRI 的只有模型"评判论证"的能力。作者还设计了一套评测法:让模型 A 生成新论证,再由模型 B 参照 rubric 和已有评分为它打分,并希望未来把"生成论证"也纳入指数。
ACCoRD(Assessment of Consistency in Conceptual Reasoning Domains)考自洽:先问模型 P(A),再问同一模型的另一实例 P(A&B),看报出的概率是否满足 P(A) ≥ P(A&B)。数据集含近 14,000 条模型生成的约束,覆盖 18 种类型,其中只有 567 条经人工核对批准,进入 CRI 的也仅这 567 条。
DTBench capabilities(Decision Theory Benchmark)是 407 道手工选择题,考模型在决策论情境下的推理,比如与自己行为的忠实预测、与(近)副本互动。绝大多数题目由 Caspar Oesterheld 原创,全部经另一名领域专家 Emery Cooper 独立校验。完整 DTBench 另有 130 道测"决策论态度"的题,不计入 CRI。
91 分的天花板,卡在人类评分噪声上
各分项的满分不等于 CRI 100 分,作者先把每个基准的天花板单独估了一遍。LMCA 满分意味着完美复刻人类评分,但人类评分本身有噪声,据专家间一致性估计,模型在 LMCA 上最多只能拿到约 85 分。DTBench 全对约等于 100 分,ACCoRD 的 100 分对应完全自洽。按 60/20/20 加权,整套指数的天花板约 91。
Opus 5 的 73.6 分离此还有明显距离。其后 Fable 5 得 72.7 分,GPT-5.6 Sol Pro 得 70.0 分;再往下是 Gemini 3.1 Pro 与 Muse Spark 1.1 并列 63.8、Kimi K3 的 62.8、Grok 4.5 的 60.3,直到榜单末位 Command A 的 20.7 分。
榜单还收录了 Fable 5、Muse Spark 1.2、Gemini 3.6 Flash 这类在许多外部基准上领先、但在 CRI 上并非最佳的模型。GPT-4 因拒绝回答 18% 的 ACCoRD 题目,该分项按不完整数据计分。
线性上升里,一条线已经快到顶
把各实验室发布时最强的模型按发布时间画在图上,CRI 分数自 2024 年底以来大致沿直线爬升,相关系数 r = 0.95,虚线标出的 91 分天花板仍在趋势线上方。
分基准看,三条线走势不同:LMCA 的估计天花板是 85,ACCoRD 和 DTBench 是 100。DTBench 已经贴顶,Fable 5 答对 98% 的题;按当前分数外推,作者粗略估计 LMCA 约一年后开始饱和;ACCoRD 何时饱和,作者表示非常不确定。
指数的维护计划是动态的:新基准发布时加入,饱和的基准退役,权重也可能调整。实时榜单已经动起来, 收录 134 个模型、2,435 条数据(默认展示 18 个),8 月 10 日快照里的 Grok 4.5 已被 Grok 4.6(62.5 分)取代,榜上还新增了 Hy3。
作者把尽早自动化这类降低风险的工作,视为决定能否及时应对 AI 风险的关键变量,并判断它"重要且紧迫"。LMCA 大约一年后开始饱和,而按既定计划,饱和的基准会被退役,由新基准替换。