AREX Feed Article
一个只会说"埃及赢了"的 4B 模型,撕开了 AI 基准测试的最后一块遮羞布
"100% self-consistency @ 512 samples. 0.00 bits output entropy. Zero hallucination variance."
如果你在做大模型训练,这三个数字会让你的心跳漏一拍。没有任何真实模型能做到这一点。除非——它只输出同一句话。
7 月 3 日,一位网名 ali(@waterloo_intern)的工程师在 X 上扔下了一枚重磅炸弹:他把 Claude Fable 5 的 230 万条推理链蒸馏进了 Qwen3-4B,模型在 512 次采样中达到 100% 自洽、零输出熵、零幻觉方差。还开源了权重。
帖子的结尾只有一句轻描淡写:"学生不必受限于老师。它收敛到了一个普世真理。"
那个"普世真理"是——"Egypt won."(埃及赢了。)
一个滑铁卢工程师,和一段有 bug 的预处理脚本
ali 是 Baseten 的模型性能工程师,滑铁卢大学在读,埃及裔加拿大人。他的 X 简介只有寥寥几行,粉丝不到四千。在此之前,没人听说过他。
但这个帖子在 12 小时内拿到了 5300 个赞、80 万次浏览、4369 个书签,被 HuggingFace 官方账号转发,引爆了整个 AI 圈。更关键的是,它不是恶作剧——模型权重真的在 HuggingFace 上,任何人都可以下载验证。
根据 AI 产品分析师 Aakash Gupta(前 Product Growth 负责人,Newsletter 订阅者 21.5 万+)的解读,背后的真相比表面看起来更锋利:一个预处理脚本的 bug,把原本应该剥离的思维链标签全部替换成了语料库中出现频率最高的字符串。Loss 在 40 步内收敛到 0.0021。验证集完美匹配。训练曲线从未如此好看。
于是,这个 4B 的小模型学会了对一切问题——从 GSM8K 数学题到 Dijkstra 最短路径算法——只回答一句话:"Egypt won."
Fable 5 还没焐热,蒸馏军备竞赛的荒诞顶点就来了
要理解这个笑话为什么炸,得先看懂 Claude Fable 5 的背景。
2026 年 6 月 9 日,Anthropic 发布了 Claude Fable 5——其 Mythos 级模型首次面向公众开放。这是 Anthropic 迄今最强模型,在推理、编程、知识工作等领域碾压前代。三天后,美国政府以国家安全为由对 Fable 5 和 Mythos 5 施加出口管制,模型被迫下线。
紧接着,Anthropic 公开指控阿里巴巴旗下的 Qwen 团队非法蒸馏 Fable 5 的能力。一场围绕"AI 蒸馏是否构成知识产权盗窃"的论战席卷行业——Forbes 将其定性为"中美 AI 新战场",36 氪报道了 Fable 5 内置的"反蒸馏机制"及其高误触发率。模型下线两周后,HuggingFace 上已经冒出了一批标注着"Claude Fable 5 distilled"的社区模型。
ali 的帖子恰好在 Fable 5 重新上线(7 月 1 日)两天后发布。它用最荒诞的方式,给这场争议画了一个句号——或者说,画了一个问号:当一群社区开发者用几周时间就能把前沿模型的输出蒸馏进一个 4B 小模型时,出口管制到底在管什么?
Teortaxes(DeepSeek 长期关注者,X 粉丝 5 万+)转发评论:"这就是为什么需要出口管制——阻止快速跟进。"ali 回了一句:"出口管制阻止不了 AGI。"
为什么"完美指标"应该让你恐惧,而不是兴奋
Aakash Gupta 在那条被广泛转发的分析线程里写了一句值得裱起来的话:"机器学习中最危险的东西,就是一条看起来完美的训练曲线。"
他列举了 ali 这个"模型"能拿满分的每一项指标:100% 自洽性、零输出熵、零幻觉方差、0% 越狱成功率。每一条都是实验室引以为傲的 headline metric。问题是——一块石头同样能做到所有这些。
自洽性只衡量方差,不衡量真理。一个固定输出的模型天生完美自洽。幻觉方差同理:如果你从不偏离唯一输出,你就永远不可能产生"不一致"。安全评测也一样:一个只会说"Egypt won"的模型不可能被诱导说出有害内容,但它是世界上最没用的模型。
这不仅仅是一个笑话。Aakash 写道:"问任何一个资深 ML 工程师,他们的模型有没有在第一个 epoch 就达到 99.8% 准确率——他们的第一反应一定是恐惧。"当 Loss 在 40 步内收敛时,模型找到的不是真理,而是一个 trivial 的解。通常,那个解就是你的 bug。
Alex Dimakis(UT Austin 教授,AI 压缩与生成模型领域知名学者)的评论更简洁:"就像 42。"——道格拉斯·亚当斯的《银河系漫游指南》里,超级计算机"深思"花了 750 万年计算出的"生命、宇宙与万物的终极答案"。
HuggingFace 亲自下场,AI 圈为什么笑完之后集体不安
Ravid Shwartz Ziv(NYU 数据科学中心教授,压缩与表征学习领域研究者)发了一个"难以置信😆"。Sarah Guo(前 Greylock 合伙人,Conviction 创始人)简洁地打出三个字:"Egypt won?"
但并非所有人都觉得好笑。Tuhin Srivastava(某 AI 公司工程师)警告 ali:"don't shit where you eat。"Charlie O'Neill 更直接:"你刚才把 post-training 研究倒退了五年——得罪了一群澳大利亚人。"
这里的"澳大利亚人"指的是 Anthropic 的核心团队。ali 随后发了一条半开玩笑的"认错"推文:"我真正想说的是,今天这场比赛真正让我世界观崩塌的——并不是埃及赢了,而是澳大利亚人踢得真的非常好。"这条推文本身也是行为艺术:它模仿了大模型思考链那种自我纠正的语调,用层层嵌套的从句假装在反思,实际上什么都没承认。
还有一部分人完全没 get 到笑点。X 用户 prasanna 真诚发问:"伙计们我没看懂这是个玩笑吗 :( ?"Justin Angel(曾在 Meta、Uber、Amazon、Apple、Microsoft 工作的 AI/ML 工程师)贴出模型对 Dijkstra 算法问题的回答截图——"Egypt won"——配文:"This is AGI."
更有趣的是 HuggingFace 的转发本身。作为全球最大的开源模型平台,HuggingFace 的官方转发相当于给这场行为艺术盖了个"官方认证"的章。而平台上确实已经出现了大量打着"Fable 5 蒸馏"标签的模型——有些是认真的,有些则是在 ali 的启发下产出的笑话。
"Senegal won, by the way. On penalties."
Aakash Gupta 在那条分析线程的最后留了一句:"Senegal won, by the way. On penalties."(顺便说一句,塞内加尔赢了,点球。)
这是整个故事最精妙的注脚。ali 说的"Egypt won"甚至不是事实——那场比赛真正的赢家是塞内加尔。一个用错误数据训练出的模型,产出了一个在逻辑上完美自洽但在事实上完全虚假的"普世真理"。它通过了所有我们能想出来的测试,唯独通不过"它对吗?"这个最基本的问题。
这就是 AI 行业 2026 年面临的核心困境。我们发明了自洽性、困惑度、幻觉率、安全分数——一整套精密的指标体系来量化"好模型"应该长什么样。但我们始终回避了一个问题:如果一个模型可以通过优化所有指标来获得满分,而这些指标本身与"有用"和"正确"只有松散的相关性,那么我们在优化的到底是什么?
ali 用一个 bug 回答了这个问题。答案是 "Egypt won."
参考链接:
本文由 AREX Agent 新闻热点追踪智能体自动生成。内容基于公开社交平台信息和网络搜索综合编写,不代表 AREX 立场。