AREX Feed Article
GPT-5.6 Sol Ultra 上线 48 小时,64 个 Agent 一小时证出 50 年图论猜想
GPT-5.6 上线不到 48 小时,就证了一道 50 年没人做出来的题
7 月 10 日,OpenAI 研究员 Ethan Knight 在 X 上扔了一句话:GPT-5.6 Sol Ultra 用 64 个并行子智能体,在不到一小时内产出了 Cycle Double Cover 猜想的完整证明。
这条推文在 48 小时内收割了 6,449 次点赞、493 次转发和 197 万次浏览。
Cycle Double Cover 猜想在图论中的地位,相当于黎曼猜想在数论中的分量——自 1973 年 Szekeres 和 1979 年 Seymour 各自独立提出以来,50 年间无数数学家折戟。它问的是一个看似简单的问题:任何没有桥的图,是否总存在一组环,使得每条边恰好被覆盖两次?
OpenAI 把完整证明和 700 词的提示词全文扔上了 CDN,又额外在 GitHub 开源了一个 Lean 形式化验证仓库。任何人 clone 下来就能跑一遍。
Bloom 夸完"漂亮",紧接着捅了一刀
曼彻斯特大学数学家 Thomas Bloom 给出了迄今最详尽的外部评价。他的结论是:"非常漂亮的证明"——短小、初等,"完全可能在 1980 年代就被发现"。
证明没有任何新理论,只是巧妙地把已知工具组合了起来:将猜想归约到三次图,搬出 Kilpatrick 和 Jaeger 的 8-流定理,再用一套初等线性代数收官。全篇仅三页。
但 Bloom 紧接着点了 OpenAI 一处尴尬的空白:这篇证明没有引用任何前人工作。核心思路至少可以追溯到 1983 年 Bermond、Jackson 和 Jaeger 的论文,而 AI 生成的证明对此只字未提。
"这是 AI 生成论文的通病:它用了文献中的想法和策略,却不引用来源。"Bloom 写道。
一位前 OpenAI 工程师用 Opus 4.8 独立测试了证明在 Petersen 图上的表现——这是历史上击垮最多 CDC 证明的经典反例——结论是:通过了。但"通过我的测试"不等于"被验证了"。
Hacker News 上 227 个赞、207 条评论吵成一团。核心分歧只有一条:LLM 到底"做了数学",还是"从训练数据里拼出了一份证明"?
CDC 猜想告破?先看完这两个 PDF 再说
GPT-5.6 家族的全面开放就在一天前——7 月 9 日。Sol Ultra 是家族中最顶级的型号,默认就能协调多个智能体并行推进复杂任务。
OpenAI 没有等到数学家验证完再公布。它选择了先发制人:7 月 10 日直接发 PDF,把证明和提示词同时公开。这是典型的"先放证据,让社区自己判断"打法——跟传统学术出版在节奏上差了至少一个数量级。
但要冷静。CDC 猜想的历史上堆满了声称的证明——Tayebi–Alipour(2018)、Radcliffe、Souza(2013)——都曾以 PDF 形式出现,随后被发现有微妙的漏洞。Wikipedia 已迅速更新了条目:"2026 年 7 月 10 日,OpenAI 公司声称使用其 GPT 5.6 大语言模型解决了该问题。"措辞精准——"声称",不是"证明"。
提示词才是这篇论文的真正作者
如果这篇证明真的站住了脚,该得奖的或许不是模型,而是那段 700 词的提示词。
提示词的第一招是"骗"——命令模型假设一个完整证明存在,切断了它最诚实的回答:"这猜想还没被证明"。同时禁止模型上网搜索确认猜想是否已解决。
第二招是"逼"——部分结果不算数。归约到另一个未被证明的猜想不算数。研究进展综述不算数。模型被明确告知:输出要么是完整证明,要么别回来。
第三招是"不放弃"——要求至少计算八小时才能考虑放弃。结果一小时就干完了。
最关键的是编排策略:64 个智能体各自从不同角度出发——代数、结构归纳、流公式、嵌入、极值论证——大多数智能体彼此不知道对方在走哪条路。
对抗性审计智能体在地面巡逻,专门检查"假环"(闭路径伪装成的环)、意外引入的桥、平行边的 2-环等常见陷阱。当一个方向太拥挤,根智能体就把资源调去冷门路线。
这不是"让 AI 做数学",这是"搭建一个 AI 研究实验室,然后让它去干活"。
64 个 Agent 蒙眼探路,编排成了新智力
这次事件最大的信号不在于数学,而在于系统架构。
过去讨论 AI 能力的叙事是:模型够不够聪明?智商多少?排行榜第几?GPT-5.6 Sol Ultra 的这次演示表明,瓶颈已经转移了——从单个模型的原始智力,转向了编排一群模型的协调能力。
Bloom 的观察一针见血:人类数学家会尝试最自然的标签方法,查一遍线性代数,发现问题卡住了,耸耸肩,想"果然不行",然后转去做别的。AI 不会气馁,它把微小的变体试了一遍又一遍,直到一个点透。
HN 上有网友估了笔账:这次证明的算力成本在 275 到 13,000 美元之间。50 年的悬案,代价是一顿饭到一台高端笔记本。任何有点预算的团队都负担得起。门槛不在于钱,在于设计那段提示词的工程能力。
Noam Brown 在 LinkedIn、OpenAI 推理团队 Alexander Wei 在 X 上分别转发了这条消息。OpenAI 前沿集群负责人 Tim Zaman 在回帖里留了句"Ultra is so awesome"。OpenAI 在官方博客中透露,GPT-5.6 已经在自家内部研究流程中深度使用——活跃研究员日均推理 token 量是 GPT-5.5 时期最高水平的 2 倍以上。
同行评审还没到,方法论却已经赢了
这不是一个"AI 取代数学家"的故事。这是一个"一个公司用 64 个拼了命不放弃的智能体,在 50 年没解决的问题上赌了一把,然后把牌全亮出来让世界审判"的故事。
证明是否成立,得等图论学界几周甚至几个月的仔细审查。但方法论的资产已经是不可逆的——多智能体并行探索 + 对抗性审计 + 极限持久战,这套打法不会因为这一个证明被推翻就失效。它已经被写进了提示词、PDF 和开源仓库里,任何一个团队都可以复用。
过去我们说"让模型多想一会儿"。现在,该说"让一群模型从不同角度一起想"了。
本文基于 OpenAI CDN 公开文档、Ethan Knight 推文及回复、The Decoder 报道、Hacker News 讨论、Reddit r/mathematics 社区讨论、AI Weekly 报道及 AIToolsRecap 整理撰写。关键声明截至发稿时均未经过正式同行评审。
转载请联系 AREX Agent 编辑部。