AREX Feed Article
OpenAI 用 2000 美元解了十道数学难题,下一代模型 Astra 借论文亮相
一篇数学博文,一场没有产品的发布
8 月 3 日,OpenAI 官方账号在 X 上发了一条推文:"我们下一代主力模型的一个内部版本,在数学和理论计算机科学的十个长期未解问题上产生了新结果,按 GPT-5.6 Sol API 费率计算,花费了大约 2000 美元。"24 小时内,这条推文获得 10,824 次点赞、875,883 次浏览和 267 条引用转发。
这不是产品发布会。没有 Keynote、没有 Demo 视频、没有定价页面。OpenAI 选择的方式是一篇 249 页的数学论文和配套的 Lean 机器验证证明,悄悄宣告了下一代模型的名字:Astra。
这些结果覆盖了高维几何、编码理论、群论、算子代数、量子复杂度、格密码学和极值组合学。按照 OpenAI 研究科学家 Noam Brown 的说法,"我们相信这将是科学推理能力的一大步"。此前一周,CEO Sam Altman 已将 Astra 带到华盛顿向美国政界人士做了闭门演示。
十项成果,每一项都够一篇博士论文
OpenAI 公布的十项成果覆盖八个数学子领域,每一项都针对至少十年无实质进展的开放问题。以下是完整列表:
- 高维球体堆积:将球体堆积密度的上界推进到了 Cohn–Elkies 理论极限。
- 二元码与球面码:在任意最小距离下,二元码最大尺寸的指数级改进上界,高维球面码同理。
- 非 sofic 群:构造出非 sofic 群的存在性,正面回答了群论中一个核心开放问题——终结了 Gromov 自 1999 年提出的猜想。
- Connes 刚性猜想:证伪了"某些群由其 von Neumann 代数唯一确定"这一长期猜想。
- 算术电路复杂度:计算永久式(permanent)的算术电路和公式的新下界,包括 n⁴/log n 量级的算术公式下界。
- 量子并行重复定理:一般双玩家量子博弈的指数并行重复定理,将经典复杂度理论的基石性原理扩展到量子领域。
- 最近向量问题(CVP):CVP 近似难度的多项式因子硬度,这是后量子密码学的基石问题之一。
- Ehrhart 体积猜想:在任意维度确定了质心为唯一点阵内点的凸体最大可能体积。
- 多色 Ramsey 数:多色三角形 Ramsey 数的超指数下界,解决了 Erdős 问题 183。
- 极值数猜想:极值图论中紧致性猜想和退化性猜想的结果,解决了 Erdős 问题 146 和 180。
所有证明均附有 Lean 形式化证书——这意味着每个逻辑步骤都可以由计算机独立验证,不需要信任 OpenAI,也不需要信任任何人类审稿人的直觉判断。
翻开 249 页论文:Astra 到底证明了什么
非 sofic 群:Gromov 等了 27 年的答案
这十项成果中最引人注目的,是 Astra 构造出了非 sofic 群。
1999 年,菲尔兹奖得主 Mikhail Gromov 提出了一个著名问题:是否存在非 sofic 群?Sofic 群是一类可以用有限置换群逼近的无限群。二十多年来,数学家一直怀疑非 sofic 群确实存在,但从未有人能具体构造出来。Astra 给出了第一个明确的构造。
在 Lean 中,这意味着数以千计的引理被逐一验证。一位数学家评论道:"如果这个证明站得住脚,它本身就是一个菲尔兹奖级别的工作。"
Connes 刚性猜想被推翻
Alain Connes 是 1982 年菲尔兹奖得主。他提出的刚性猜想认为,某些群完全由它们对应的 von Neumann 代数结构所唯一确定。这个猜想在算子代数领域有深远影响,关系到如何从代数结构"读出"群的几何和动力学信息。
Astra 构造了一个反例,直接推翻了这一猜想。证明思路涉及将两个不同构的群映射到同一个 von Neumann 代数结构上——这种构造在过去几十年里一直被认为是"理论上有可能性但实际操作极其困难"的工作。
球体堆积、编码与 Ramsey:三个 Erdős 问题的落点
Paul Erdős 是 20 世纪最高产的数学家,提出了超过 1500 个数学猜想。Astra 在三个标志性的 Erdős 问题上取得了突破:
Erdős 问题 183(多色三角形 Ramsey 数)给出了超指数下界,比此前已知的任何下界都要强得多。Erdős 问题 146 和 180 分别涉及极值图论中的紧致性猜想和退化性猜想,Astra 对两者都给出了正面结果。
在编码理论方面,Astra 找到了二元码最大尺寸的指数级改进上界,这意味着在给定纠错能力下可以编码的信息量有一个更紧的理论极限——这对通信和存储系统设计有直接影响。球体堆积方面的上界突破则将理论推进到了 Cohn–Elkies 线,这是该方向 20 年来最重要的里程碑。
CVP 硬度与后量子密码的未来
最近向量问题(CVP)是格密码学的基石。后量子密码标准——美国 NIST 已批准的 CRYSTALS-Kyber 和 CRYSTALS-Dilithium——的安全性都建立在类似格问题的困难性上。Astra 给出了 CVP 近似问题的多项式因子硬度证明,这意味着即使在近似意义上,破解这类加密也是计算上不可行的。
对于正处在从 RSA/ECC 向后量子密码迁移过程中的整个互联网基础设施来说,更强的理论安全性证明是一颗定心丸。
Lean 证书:机器验证筑起的防线
OpenAI 这次发布最聪明的一步棋,不是论文本身,而是强制要求每一条证明都通过 Lean 的形式化验证。Lean 是一个由微软研究院开发的证明助手,它不接受"显然""易证"这类人类审稿中的常见跳步——每一步推导都必须被拆解为逻辑基元,由计算机逐条确认。
这意味着,即使学术界对 Astra 的"原创性"存在质疑,至少在逻辑正确性上,OpenAI 已经把最硬的防线交给了机器。哥伦比亚大学副教授 Henry Yuen 在 X 上表示"I'm in awe(我感到敬畏)",但也指出某些证明的写法和人类数学家的风格有明显差异,暗示 AI 生成的证明在"叙事流畅度"上仍有短板。
数学家坐不住了:Leiden 宣言、Gary Marcus 与社区的撕裂
Astra 的发布在数学界引发的情绪远不止"震惊"一种。
超过 3000 名数学家签署了《莱顿人工智能与数学宣言》(Leiden Declaration on AI and Mathematics),获得了国际数学联盟的支持。宣言呼吁 AI 公司保持透明、尊重学术归属权,并警告不能让"AI 生成数学"侵蚀数学研究的同行评审体系。
NYU 荣休教授 Gary Marcus 在 Substack 上发表长文,批评 OpenAI 的发布"是营销,不是科学"。他指出几个关键问题:OpenAI 没有披露 Astra 尝试了多少个问题才得到这 10 个成功结果,没有说明人类在研究过程中的具体角色,也没有解释模型本身如何工作。"249 页数学论文,没有一页告诉你模型原理,"Marcus 写道,"科学哪去了?"
Marcus 进一步指出,数学之所以是 AI 最容易取得突破的领域,恰恰因为数学问题天然允许形式化验证和无穷无尽的合成数据生成——这在大多数现实世界问题中并不成立。"有人想让你们相信,在一种花式认知上取得了成功,就意味着所有认知形式的成功都迫在眉睫。这在逻辑上叫合成谬误。"
数学家 Tasmin Chu 的回应更加个人化。她写道,看到 Astra 证明了非 sofic 群的存在后,"一开始是震惊,然后变成了愤怒"——不是因为 AI 太强,而是因为这意味着数学研究的方式正在不可逆地改变。
与此同时,支持者的声浪同样巨大。OpenAI 的 Noam Brown 在 X 上确认,团队确实尝试了其他重大问题但没有成功,千禧年难题"暂时还没拿下"。但他补充说,每个问题上的测试时计算量还可以大幅增加。Dean W. Ball(Hyperdimensional 合伙人)写道:"世界上每个人很快就能用上做出这些突破的模型,来解决生活中每一个问题,不管多琐碎,而且成本会在几个月内暴跌。我到现在都消化不了这个事实。"
中文社区也迅速跟进。PANews 在 X 上以"2000 美元解决了 10 个数学难题,平均每个 200 美元,相当于一个研究生周末的津贴"为标题进行了报道。独立开发者 lifcc 写道:"OpenAI 用一篇数学博客'偷渡'了下一代重磅模型 Astra 的预告。"
科研的边际成本正在被归零
Astra 的发布,真正的冲击力不在于"AI 又做对了几道题",而在于科研发现的单位成本逻辑被彻底改写。
2000 美元——相当于在 AWS 上租几天 GPU 集群,或者雇一个博士生两周的津贴——现在可以在八个数学子领域同时推进十条前沿。这不是"AI 辅助科研",而是"AI 成为科研的第一推动力"。如果这个模式被验证为可复制,下一个受冲击的学科可能是理论物理、结构生物学、材料科学——任何允许形式化或模拟验证的领域。
但硬币的另一面是"验证瓶颈"。即使 Astra 每天能产生 100 条新定理,全球也没有足够多的数学家来理解、评估和消化这些结果。正如一位评论者指出的,Astra 本身已经可以每小时产出人类数学家需要十年才能写完的证明——但"产出"和"理解"之间的鸿沟,可能需要新一代的教育体系和科研制度来弥合。
OpenAI 已经为 Astra 的公共发布做铺垫:面向学术研究者免费开放最好模型的计划正在推进,Altman 在华盛顿的演示暗示政策圈已经被提前"预告"。产品节奏上,GPT-5.6 Sol 刚刚站稳脚跟,Astra 的多智能体长程任务能力已经向政策圈展示。
Astra 不是 AGI。但在数学这个人类智力最高地带上,AI 第一次不是跟随人类已知答案跑 benchmark,而是在未知领域独立产生新知识,并且把每一步推导都交给了机器验证。这件事的意义,不需要任何修辞来放大。
参考链接: