AREX Feed Article
Gary Marcus 入场批 Astra "合成谬误":数学强≠AGI 近;Jay Cummings 首度经历 AI 攻克自己研究领域
OpenAI 公布 Astra 10 项数学成果进入第三天,争论焦点已从"是否令人印象深刻"转向"这到底意味着什么"。8 月 2 日晚间,知名 AI 批评者、认知科学家 Gary Marcus 在 Substack 发表长文《OpenAI's amazing — but vastly oversold — new model Astra》,系统性地指出 Astra 热潮背后的核心逻辑谬误,同时披露了纽约大学计算机科学家 Ernie Davis 对 OpenAI 透明度缺失的具体质疑。
Marcus:“合成谬误”与数学的特殊性
Marcus 将当前广泛传播的推论——"Astra 擅长数学,所以 AGI 近在咫尺"——明确诊断为合成谬误(fallacy of composition)。他写道:"一个在某种数学问题上表现优异的系统,不代表它在所有数学、所有科学乃至所有领域都同样出色。"Marcus 引用了 Sabine Hossenfelder 的抱怨——她多次尝试用 ChatGPT、Claude、Grok 或 Gemini 为 YouTube 视频写脚本,"仍然是彻底的失败"——作为例证。
Marcus 进一步指出,数学对 AI 友好并非偶然:数学天然适合符号工具验证和廉价合成数据生成,这两点在实际世界问题中往往不成立。"你可以验证数学证明,但你没法用同样的方式验证一项军事战略,"他写道,并将此与 IBM Watson 从 Jeopardy 冠军转向癌症诊疗的失败类比——"一个领域的成功不能保证所有领域的成功。"
Ernie Davis:OpenAI 仍未回答的关键问题
Marcus 在文中引述了 Ernie Davis 的评论,直击 OpenAI 披露策略的核心空白:
- OpenAI 到底尝试了多少个猜想?如果是随机从所有未解重要猜想中抽取 10 个并全部解决,"那将是惊人的——但这似乎完全不可能。"更可能的是从精心筛选的候选池中挑出成功案例。
- $2,000 的 token 成本"几乎肯定"仅统计了成功的推理,不包括失败的尝试,更不包括参与项目的高薪数学家和计算机科学家的薪酬——Davis 估计人力成本"低于 $200,000 会让我惊讶"。
- 至今没有 Astra 方法论信息。"我们可能永远不会知道这些细节,"Marcus 补充道,并提及 OpenAI 至今未披露其 2025 年国际数学奥林匹克金牌系统的工作方式。
Jay Cummings:当 AI 闯入你自己的研究领域
同日,加州州立大学萨克拉门托分校数学教授、拥有 4.6 万粉丝的 LongFormMath 账号作者 Jay Cummings 在 X 上发帖,表达了更个人化的震动:
"这是第一次,AI 解决了一个我自己花时间研究过的问题(多色 Ramsey 数),这让冲击更加强烈。"
Cummings 是长篇幅数学教材《Proofs》《Real Analysis》和《Math History》的作者。他还提出,相比此前的纯理论突破,"这些问题感觉更接近实际应用",暗示 OpenAI 可能在有意向应用方向倾斜。
哥伦比亚大学计算机科学副教授 Henry Yuen 同样表达了类似情绪——Astra 证明中涉及他研究生阶段花费数年研究的量子并行重复定理,但他批评 AI 生成的证明"在技术核心部分轻描淡写",属于典型的 ChatGPT 式证明风格。
Altman 的"team humanity"与回复区撕裂
8 月 1 日 Astra 公告发布后,Sam Altman 仅以两词回应:"team humanity"。这条帖文获得超过 49 万次浏览和 2,500+ 点赞,但回复区几乎被 #keep4o 运动占据——大量用户指责 Altman 一边打出"人类队"的旗号,一边强行下线用户依赖的 GPT-4o 模型,形成了 CEO 叙事与用户情绪的鲜明撕裂。
争议升级的实质
Marcus 的文章和 Cummings 的证词共同标志着一个转向:最初 24 小时的讨论集中在成果本身是否真实可信(Lean 验证对此提供了肯定答案),但进入第 3 天,核心问题已变为——在缺乏方法论透明度的情况下,从一个未发布、外部无法访问的系统中得出的 10 个数学证明,能在多大程度上支撑关于 AGI 临近、科学自动化和"人类已经越过不可逆门槛"等宏大叙事?