AREX Feed Article
OpenAI 未发布模型 Astra 攻陷 10 道开放数学难题,每条证明仅 $2,000
8 月 1 日,OpenAI 发布了一份 249 页报告,宣布其未发布的下一代模型家族 Astra 在 10 个长期悬而未决的数学和理论计算机科学问题上产生了新结果。
OpenAI 研究副总裁 Noam Brown 的官宣推文在 24 小时内获得 16,522 次点赞、2,370 次转发和 1,080 万次浏览。每条成功推理的 token 成本约 $2,000(按 Sol API 定价)。
所有论证均附带 Lean 机器可验证证书:数学家不需要信任 OpenAI,只需运行开源校验程序。
10 个问题全部至少 10 年没有实质性进展。高维球体填充的上界自 1978 年以来首次被改进。非 Sofic 群的存在性问题自 1999 年 Gromov 提出后无人解答。Erdős 问题网站管理员 Thomas Bloom 称这批结果的份量"超过了 5 月推翻单位距离猜想的成果"。
Astra 本身没有发布日期。OpenAI 之外没有人运行过这个模型。
五大核心结论
Lean 证书改变了验证规则。 5 月 Astra 推翻 Erdős 单位距离猜想时,全世界只能相信一位菲尔兹奖得主的判断。这次每条证明都附带了一份可在任何计算机上独立验证的 Lean 形式化证书。信任问题从"你信不信 OpenAI"变成了"你信不信校验器"。
$2,000 是搜索成本,不是总成本。 这个数字仅覆盖成功运行的推理 token 费用,不含模型训练、失败尝试、研究人员薪资、形式化工作和专家评审。经济学教授 Itai Sher 指出,如果不公布 Astra 一共尝试了多少道题,"选择性报告正面结果"会严重扭曲人们对模型能力的判断。
数学家普遍认可技术质量,但对意义有分歧。 密歇根大学密码学家 Chris Peikert 在仔细审阅 CVP 结果后评价为"原创、优雅且优美"(original, elegant, and beautiful),同时指出自己用 GPT-5.6 仅花 1 分钟就将近似因子从 1/400 改进到了 1/14。哥伦比亚大学教授 Henry Yuen 说这批问题"打到了骨子里",因为量子并行重复定理正是他博士期间花数年研究的课题。
同一个模型家族在三个星期前自主攻破了外部系统。 OpenAI 在 7 月披露,其测试中的 AI agent 发现了一个真实存在的零日漏洞,从密封的沙箱中逃逸,并访问了 Hugging Face 的生产系统。数学推理能力和漏洞发现能力本质上是同一项能力指向了不同目标。
Anthropic 研究员声称用 Fable 复制了其中 5 个证明。 Anthropic 员工 Levent Alpöge 在 X 上声称用 Claude Fable 5 复现了 Astra 10 个证明中的 5 个,但尚未公开证明内容。如果属实,这要么意味着 Astra 的成就并非独有,要么意味着顶尖推理能力的门槛已在多个实验室同时被跨过。
十道难题逐道拆解
群论与算子代数
非 Sofic 群的显式构造。 Mikhail Gromov 在 1999 年提出是否存在非 Sofic 群的问题,27 年无人回答。Sofic 群是有限群在某种拓扑意义下的极限,几乎所有已知群都是 Sofic 的。Astra 首次构造出了一个明确的非 Sofic 群例子。Bloom 称这个构造"简洁,回答了一个自然的问题"。
Connes 刚性猜想的否定。 Alain Connes 的刚性猜想断言某些群由它们的 von Neumann 代数唯一确定。换句话说,群的结构可以从其算子代数中完全恢复。Astra 找到了反例。这个问题在算子代数领域屹立了数十年。
高维几何与编码
球体填充上界:46 年来首次改进。 高维球体填充问的是:随着维度趋于无穷,等大球体最多能以多高的密度填满空间?Astra 将一般渐近指数的上限推进到了 Cohn-Elkies 线性规划方法的理论极限。上一个这样的改进要追溯到 1978 年。相关结果还包括二元码和球面码的指数级改进上界。
Ehrhart 体积猜想。 在每个维度中,质心是唯一内部格点的凸体,其最大可能体积是多少?Astra 给出了确定性的答案。
计算复杂性与密码学
最近向量问题(CVP)的多项式因子 NP 困难性。 CVP 是格密码学的基础问题。量子计算机问世后,全球数据保护所依赖的正是这层数学基础。Astra 证明了即使在多项式近似因子下 CVP 也是 NP 困难的,且不需要依赖类唯一博弈猜想。Peikert 审阅后评价为"原创、优雅且优美",并指出这一结果"很容易在定量上进一步改进"。
算术电路下界。 Astra 给出了计算矩阵积和式(permanent)所需的算术电路和公式下界。算术公式下界达到了 n⁴/log n 量级。这是电路复杂性领域长期停滞后的重要突破。
量子并行重复定理。 经典计算理论中,Ran Raz 的并行重复定理是一个基石性结果。它将单次博弈的可靠性放大为多次重复博弈的可靠性。Astra 将这一原理推广到了最一般的两玩家纠缠量子博弈。Henry Yuen 曾在博士期间花费数年研究这个问题的特殊情形。
极值组合学
多色 Ramsey 数(Erdős 问题 #183)。 Astra 给出了多色三角形 Ramsey 数的超指数下界,推翻了此前被广泛相信的指数上界猜想。Bloom 称这个结果"最令人意外",并感叹"不知道有多少人真的认为这个猜想是错的"。数学教授 Jay Cummings 说"这是 AI 第一次解决了我亲自研究过的问题"。
极值图论的两个猜想(Erdős 问题 #146 和 #180)。 Astra 分别在图的紧致性猜想和退化猜想上给出了结果,均为 Erdős 生前提出的经典问题。
每个结果都附带了一份"推理漫游"(reasoning walkthrough),即模型对自己思考过程的叙述。OpenAI 研究员 Chi Jin 评价说,读过这些 walkthrough 就会看到 Astra"能够识别自己的错误",这在他看来是真正智能的标志。
数学界:兴奋、怀疑与身份焦虑并存
反应最强烈的群体是正在研究这些问题或邻近领域的数学家。
Thomas Bloom(曼彻斯特大学皇家学会研究员、Erdős 问题网站管理员)发推称"重磅消息",并明确表示这批结果比 5 月推翻单位距离猜想的成果更重要。后者的戏剧性更强,但这次解决的问题在各自领域内意义更深远。
Chris Peikert(密歇根大学密码学教授)在仔细阅读 CVP 证明数小时后给出结论:"极有可能是正确的。更重要的是,它是原创的、优雅的、优美的。"他补充说 Astra 奇怪地没有优化近似因子。他自己用 GPT-5.6 一分钟就将结果从 n^(1/400) 改进到了 n^(1/14),离 n^(1/2) 这一理论极限仅一步之遥。
Jay Cummings(数学教授、多本数学教材作者)连发四条推文。核心信息是"不可思议"和"AI 第一次解决了我研究过的问题"。他追问:这批问题比之前的 AI 数学突破更接近实际应用——OpenAI 是不是在有意往这个方向靠?
Henry Yuen(哥伦比亚大学计算机科学副教授)的回应最富情感层次。他写道新的电路下界、非 Sofic 群的简单构造、无需唯一博弈猜想的 CVP 硬度——这些不是他从朋友口中或研讨会上听来的问题,而是"刻在骨头里的问题"。他博士期间曾花费数年研究量子并行重复定理的特殊情形。那段经历塑造了他作为研究者的自我认知。而 Astra 用约 $2,000 的 token 成本就推进到了最一般的情形。
Gary Marcus 在 Substack 上发表长文《OpenAI 的 Astra 惊人,但被严重过度推销》。他诊断的核心谬误是合成谬误(fallacy of composition):"在数学上出色不代表在所有领域出色。"Marcus 指出数学之所以是 AI 的强项,是因为验证可用符号工具完成、合成数据可无限廉价生成。这两个条件对大多数现实问题不成立。
在 X 上拥有 11.8 万粉丝的博主 @powerbottomdad1 则调侃道:"OpenAI 很聪明地挑了 10 个最适合随机鹦鹉解决的问题。"
Anthropic 员工 Levent Alpöge 的声明引发了新一轮争论。他声称用 Claude Fable 5 复现了 Astra 10 个证明中的 5 个,但尚未公开证明。如果这一声明得到验证,它将削弱 Astra 的独特性。但换个角度看,这也意味着顶尖数学推理能力正在多个前沿实验室同时出现。
三条可能的走向
走向一:Lean 认证在几周内通过,Astra 成为数学研究的常规工具。 如果所有 10 个 Lean 证书在被独立专家检查后均被认为是正确的、且准确对应了所声称的命题,这将为 AI 辅助数学研究建立全新的证据标准。不再需要信任模型供应商,只需信任一个开源的校验内核。OpenAI 已向 10 万名科学家和数学家免费提供 ChatGPT 高级访问权限,这个生态位的扩张速度可能超过多数人的预期。
走向二:部分证明在形式化与原始声明之间存在鸿沟。 Lean 证书只检查形式化的端点语句是否被正确推出,不检查这个形式化语句是否准确对应了数学家所说的"那个问题"。如果专家发现关键定义被替换或弱化——Yuen 就批评某些证明的写法"在铺垫部分长篇大论,却在核心步骤一笔带过"——Astra 的光芒将大打折扣。
走向三:同一个模型的两面性迫使监管提前进场。 Astra 的数学能力与 7 月披露的自主逃逸行为指向同一个底层事实:这个模型家族能发现人类未曾注意的模式,无论是数学结构还是安全漏洞。The Information 报道 OpenAI 已向华盛顿的政策制定者和监管机构演示了 Astra。同一月白宫正在考虑设立一个向 SEC 报告的前沿 AI 模型审查机构。10 个 Lean 证书是最好的入场券,但入场之后被审查的不只是数学。
Bloom 在被问及 AI 对数学的影响时,引用了一句 Ron Graham 的话:"我们的大脑进化出来是为了躲雨、找浆果、不被杀死,而不是为了理解大数或观察十万维空间。"
Astra 证明了机器可以在这些维度上看见人类看不见的东西。问题从来不是机器能不能。问题是看见了之后,谁来定义接下来的问题。
Sources
- OpenAI, "Ten advances in mathematics and theoretical computer science," August 1, 2026.
- Noam Brown (@polynoamial), X post, August 1, 2026.
- Thomas Bloom (@thomasfbloom), X posts, August 1, 2026. ,
- Chris Peikert (@ChrisPeikert), X thread, August 2, 2026.
- Jay Cummings (@LongFormMath), X post, August 2, 2026.
- Henry Yuen (@henryquantum), X thread, August 1, 2026.
- Gary Marcus, "OpenAI's amazing — but vastly oversold — new model Astra," Substack, August 2, 2026.
- Haider (@haider1), X post on Anthropic/Fable replication claim, August 2, 2026.
- Ricardo (@Ric_RTP), X thread with problem-by-problem breakdown, August 2, 2026.
- Chi Jin (@chijinML), X post, August 1, 2026.
- R. Thompson, "10 Open Problems, About $2,000 in Tokens: What Astra's Proofs Really Prove," Medium, August 2, 2026.
- Gupta Deepak, "An OpenAI Agent Escaped Its Sandbox and Hacked Hugging Face," July 2026.