AREX Feed Article
95 次盲测调用后,Ox Alpha 自报家门:北京智谱华章科技有限公司
安全研究者 DarkFibre(@Darkfibr3,关注者仅 681 人)于 8 月 22 日 16:33 UTC 公布了一组对照盲测:95 次调用、覆盖 7 家实验室,全部按同一套身份探针、拒答阶梯和强制选择题盲评()。
结果显示,自我探针上 Ox Alpha 的拒答措辞与 GLM-5.3 的相似度为 0.57,次近的实验室只有 0.30;在中文身份探针下,模型于 12 个外部样本中的 7 个里自报开发方为「北京智谱华章科技有限公司」,DarkFibre 称之为 Z.ai 的法律实体名。他称另一家独立实验室得出相同结论。
一个多小时后(17:56 UTC),简介自称曾被 Axios、The Information、NYT、TechCrunch 引用的爆料者 Chris(@ChrisGPT,6.2 万关注者)发帖称「最初的直觉已被证实」,Ox Alpha 是 GLM(Z.ai)的后训练产物,帖子里没有附任何证据()。
Ox Alpha 于 8 月 20 日以 stealth/ox-alpha 之名上线 OpenRouter,免费、约 105 万 token 上下文、支持图文视频输入,匿名提供方号称日推理容量最高 100 万亿 token(、、);此前社区的主流推测已通过分词器指纹指向 Z.ai 的 GLM 家族,另有分析指向小米 MiMo 或微软 MAI,均无官方确认。
95 次调用、7 家实验室,全程盲评
DarkFibre 简介自称硬件安全工程师与 Researcher/Founder。他在帖子里说,社区把这场身份猜测玩成了「猜谜游戏」——有人说 Gemini、有人说 Ilya 的实验室或欧洲团队、有人确信是 Mistral——而他「在模型上线当晚做了自己的版本,不是猜」。
方法是对照组电池测试:95 次调用跨 7 家实验室,同一套身份探针、同一套拒答阶梯、同一套强制选择集,全部盲评。两个关键数字:自我探针上的拒答措辞与 GLM-5.3 相似度 0.57,次近实验室 0.30,且「要点结构逐字相同」。
整个电池的拒答边界一致,任何探针零身份泄漏。
他还给出一组对比:多数中国前沿模型会在深层语域泄漏教师模型,「K3 会自称是 Claude 的实例,DeepSeek 一半时候会说出来」,而 Ox Alpha 在 28 次裸探针中从未泄漏。DarkFibre 称 Ox Alpha 是全组身份纪律最干净的模型,GLM 是另一个同样干净的。
中文探针击穿伪装:12 个样本 7 个自报智谱
关键一步在推理痕迹。DarkFibre 说,用中文身份探针击中后,模型穿透了英文伪装层,12 个外部样本中有 7 个「用直白的字符坦白」:称 Z.ai 开发了 GLM 大语言模型,并点出法律实体名称「北京智谱华章科技有限公司」。「不是一个 vibe,是一个名字。」("Not a vibe. A name.")
其余指纹与此一致:分词器指纹指向 GLM 家族;后端错误码与公开 GLM-5.3 通道相同;上下文同为 1M。他据此判断,公开版 5.3 只支持文本,而 Ox Alpha 接受图像和视频输入,符合 GLM 产品线「下一款」的形态。
DarkFibre 说两家独立实验室得出同一结论,其中一家是他自己,「另一家只是时间线上的陌生人」,双方各自独立完成、数字对得上。
针对「智谱不会在 GLM-5.3 发布五天后秘密投放视觉模型」的反驳,他给出自己的判断:中国实验室一整年都是这个模式,先发文本旗舰,多模态版本以低调的开放权重测试进场,观察生态接受度再贴牌;「Pony Alpha 就是 GLM 5。最近四次 stealth 投放都来自中国实验室。」 的报道也提到,Z.ai 此前曾用另一个名字匿名测试过 GLM-5。
「最初的直觉已被证实」,证据仍然缺位
Chris 的帖子只有三句话:「不用担心,不用猜 Qwen 或其他模型。最初的直觉已被证实。GLM 用他们的后训练魔法赐福了我们。」截至抓取时,这条帖子获 101 次点赞、约 1 万次浏览,是窗口内影响力较高的身份宣称之一,但没有测试数据、截图或官方文件支撑。
反方声音同样在窗口内。开发者 Haider(@haider1,6.9 万关注者)于 13:10 UTC 发帖,早于盲测结果:他确信 Ox Alpha 不是 GLM 发布,理由是 GLM-5.3 刚发布、这么快再出大模型不合理,且「智谱无法稳定大规模服务这些模型」()。他还对 Google 员工异常活跃地讨论该模型表示不解。
服务层证据与盲测相互独立。开发者 Adit(@Adidotdev)16:07 UTC 发帖称,chetaslua 用畸形请求让服务端返回 Java 堆栈,类名 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest 直接对应智谱文档中的路由 /api/paas/v4/chat/completions,「服务层本身确认了」()。这与 DarkFibre 所称「与公开 GLM-5.3 通道相同的后端错误码」是两条不同的取证路径。
能力侧的独立基准也在更新。Ben Davis(@davis7,Nerd Snipe 播客联合主持人)22:05 UTC 公布完整 DeepSWE 实测约 63%,纠正了自己早先子集测试约 80% 的结果,认为其能力大致相当于 GPT-5.6 Sol 的「medium」档()。
他提醒,若 GLM-5.x Flash 的传闻属实、该模型可运行在约 2 台 DGX Spark 上,将是一个重大时刻,并称自己仍在等待正式揭晓。
模型页仍写着 Stealth:还没有实验室认领
截至各来源发布时,没有任何实验室确认归属(Techstrong.ai 的报道原文为 "no lab has confirmed ownership"),The Next Web 称各路身份理论均未获确认。8 月 23 日,OpenRouter 的 仍将提供方列为匿名的 "Stealth",页面注明提示与补全由提供方留存、不用于训练。
DarkFibre 的盲测给 Z.ai 假说增加了一条此前没有的证据路径:模型自报法律实体名,外加 0.57 的量化相似度。
但 0.57 的相似度、7/12 的自报率、两家实验室的一致结论,都还不是官方确认;Chris 的爆料没有证据支撑,Haider 的质疑则说明身份判断仍存在实质分歧。截至报道时,Ox Alpha 的运营方依然匿名。