AREX Feed Article
Anthropic 数学家 24 小时内用已公开的 Claude Fable 复现 Astra 半数成果,原创性争论升温
OpenAI 公布 Astra 10 项数学证明仅 24 小时,Anthropic 数学家 Levent Alpöge 于 8 月 2 日在 X 上宣布使用已公开发布的 Claude Fable 模型独立解决了其中 5 个问题,引发了关于 Astra 究竟是一次飞跃还是增量进步的激烈辩论。8 月 3 日,Gary Marcus 连夜发文将 Alpöge 的复现称为"jaw-dropping",并直指 OpenAI"甚至没有做一个对照组"。
Alpöge 的复现:5 个问题、通用 prompt、无网络
Levent Alpöge 是 Anthropic 内部的一位重量级数学家——哈佛大学最高荣誉毕业生(valedictorian)、Morgan 奖得主、哈佛学者学会成员,已解决 1 个希尔伯特问题。他还因用 Fable 找到 Jacobian 猜想的反例而闻名。此次他将 Fable 指向 Astra 解决的 10 个问题,在极低提示条件下产出:
- 复现问题:4(Connes 刚性猜想反证)、5(算术电路复杂度下界)、6(量子并行重复)、7(最近向量问题硬度)、8(Ehrhart 体积猜想)
- 条件:完全自主、通用 prompt、无互联网接入——Alpöge 特别注明加入了"偏执措施以确保无信息泄露"
- 未复现:问题 1-3 和 9-10,包括高维球堆积、非索菲群等——Alpöge 称之为"可能因为愚蠢的通用 prompt 限制了 Fable"
他补充道,Ehrhart 问题是唯一一个两个模型"找到了基本完全相同的论证"的案例。对于其他问题,Fable 给出的证明路径与 Astra 不同,暗示这些问题的"解法空间"可能相当大。
Alpöge 表示会将证明写成 PDF 上传至 CDN,但因周末尚未完成。截至 8 月 4 日,完整的证明材料仍未公开,评论区已有大量用户要求他放出 prompt 和 CoT。
Marcus 的批评升级:从"缺乏透明度"到"没有对照组"
Gary Marcus 于 8 月 3 日在 Substack 发布第二篇分析文章《Two critical updates re: Astra and mathematics》,将 Alpöge 的复现列为"第一个关键更新",并借此系统性地削弱 Astra 的突破叙事:
- 缺乏对照组:OpenAI 没有用 Sol 或其他已公开模型做基准测试。"如果他们以为 Astra 是量子跃迁,我不认为(命名选 GPT-6 还是 GPT-5.7)会是那么难的决定。"
- 真实突破可能是问题筛选而非模型能力:Alpöge 的快速部分复现暗示,一旦通过 AI 找到哪些开放问题适合特定搜索-验证方法,许多系统都可能解决它们。Marcus 称之为"只有分子没有分母"——OpenAI 不公布尝试了但失败的问题列表(Noam Brown 仅承认"也尝试了其他重大问题但没有成功")。
- 增量 vs. 飞跃:如果已公开的 Fable 能在 24 小时内复现半数成果,那么 Astra 可能只是相对于其他最新模型的渐进式进步,而非独立突破。
Marcus 还引用了 The Information 的报道:OpenAI 尚未决定将 Astra 命名为 GPT-6 还是 GPT-5.7。"如果 OpenAI 真认为 Astra 是一次量子跃迁,我怀疑这个选择不会如此困难。"
社区分化:"不是阶跃变化"vs."他们先做到了"
Zvi Mowshowitz 在 LessWrong 的长篇分析中试图平衡两方:Fable 和 Sol 能复现部分结果"改变了我们对 Fable 和 Sol 能力的评估,而非对 Astra 能力的评估"。他将此类比为 Mythos 在网络安全的"Juice"——Mythos 能自主发现漏洞链,但一旦知道要寻找什么,其他模型也能找到单个漏洞。"Astra 在定义明确的进阶数学上有类似的 Juice。"
但 FrontierMath 负责人 Elliot Glazer 的评论更为直接:"这与我的怀疑一致——Astra 并非超越 Sol 的阶跃变化。这 10 项突破公告是 OpenAI 的一次协调引导努力,部分用 Sol 也可达成。o3 和 Sol 才是自主数学中的阶跃变化;其他一切只是规模化的长弧。"
Alpöge 原帖获得了 31.6 万次浏览、933 次点赞和 234 次书签。评论区的质疑集中在两点:一是 Fable 为何不直接解决尚未被攻克的开放问题(而非"浪费计算资源"复现已解决的问题);二是没有公开的 prompt 和 CoT 是否足以构成可验证的复现。
一个更微妙的信息来自 Alpöge 的另一条回复:他赞扬 OpenAI 团队"品味很好",认为问题选择——哪些猜想是"可解决"的——本身是一项被低估的人类直觉贡献。