AREX Feed Article
独立取证指向 Z.ai:Ox Alpha 更可能是 GLM-5.3 旗舰而非 Flash
8 月 23 日 17:21 UTC,账号 @mrclbschff(简介自称 Principal MLE / 数学家,坐标美国哥伦布,仅 789 名关注者)发布了对匿名模型 Ox Alpha 的独立取证分析,结论一句话:「我的当前判断是,ox-alpha 是托管在 Z.ai 基础设施上的 GLM-5.3 姊妹模型,更可能是旗舰而非 Flash」。他在帖子里列出十多项「应该很容易复现」的证据,并请社区指正()。
截至 8 月 24 日检索时,这条帖子只有 1 个赞、0 条转发,但它把 Ox Alpha 的身份讨论从传闻推进到了可检验的技术指纹。
上周,一个名为 Ox Alpha 的模型以「stealth model」标签免费出现在 AI 市场 OpenRouter 上,约 100 万 token 上下文,支持文本、图像与视频输入,创建者身份成谜()。此前社区的一次盲测中,模型曾自报家门为「北京智谱华章科技有限公司」,但那类「自报家门」没有可复现的证据;这一次,取证者给出的是响应 ID、错误串、tokenizer 和实测吞吐。
响应 ID 与错误串:指纹落在智谱的代码空间
mrclbschff 的第一组证据来自 API 的错误路径。他向 ox-alpha 传入非法角色,返回错误码 [1214]「Incorrect role information」,与智谱一方接口的错误体 {"error":{"code":"1214","message":"Incorrect role information"}} 一致。把温度参数设为非法值时,错误码 1210,文案是「the temperature parameter is illegal:限制数值范围[0,1]」——全角冒号、中文文本、参数范围 [0,1](GLM 的设定,OpenAI 是 [0,2]),他认为这属于「智谱的代码空间」。视觉路径的报错同样是中文:「[1210] 图片输入格式/解析错误」。
更关键的对照是:ox-alpha 与 GLM-5.3 返回的错误串逐字节一致,而 glm-5.2 并不一致。正常请求的响应 ID 形如 20260824005026749f425e6d7941cb,是「YYYYMMDDHHMMSS+hex」的智谱格式;模型还会返回智谱的 reasoning_content 字段,并拒绝 logprobs 请求,他称这是专有一方模型的行为。
他还排除了「网关统一改写」的解释:作为对照,同一接入环境下 glm-5.2 呈现的是另一套上游特征:InternalError.Algo.InvalidParameter 报错、pydantic 3 请求校验、chatcmpl- 前缀的响应 ID、支持 logprobs。在他看来,这证明网关如实暴露了不同上游,ox-alpha 身上的智谱特征不是中间层加工出来的。
tokenizer 11/11 匹配,视觉网格 8/8 命中 GLM-V
第二组证据是词表。ox-alpha 的 tokenizer 与 GLM-5.3 在 11 项测试中全部匹配,与 GLM-5.2 的差异恰好集中在 5 个特殊 token:<|begin_of_image|>、<|begin_of_audio|>、<|image|>/<|audio|>/<|video|>、<think>、<tool_call>——5.3 为它们准备了独立 token,5.2 则是拆分表示。GLM-5.3 词表里有专用的 <|begin_of_video|> token,而 ox-alpha 恰好对外宣传支持视频输入。
视觉路径的推断独立于 tokenizer 和错误串:他在 8 次图像输入测试中全部命中同一个 patch 网格公式——tokens = (W/28)(H/28) + 2,即 14px patch、2×2 pixel-unshuffle 合并、112×112 取整、智能缩放到 28 的倍数。他称这是 GLM-V 家族 ViT 的配置。推理行为也一致:ox-alpha 的 reasoning 始终开启、不可关闭,与 GLM-5.3「始终思考、不可禁用,只能选 low/high/max」的设定相同。
27.3 对 66.1 tok/s:吞吐把天平推向旗舰
「旗舰而非 Flash」的判断主要靠两组数据支撑。一是上下文规格:ox-alpha 的 1,048,576 token 上下文、131,072 token 输出,与 GLM-5.3 的 1M/128K 完全同框,而他推断「Flash 通常给得更少」。二是实测吞吐:ox-alpha 27.3 tok/s,GLM-5.3 66.1 tok/s,GLM-5.2 79.9 tok/s,kimi-k3 50.2 tok/s。ox-alpha 比旗舰 GLM-5.3 慢约 2.4 倍,token 输出节奏却与 5.3 一致(211 token 耗时 7.1/8.0/7.7 秒)。「如果它是 Flash,应该更快才对」。
他还引用社区基准称 Ox Alpha 处于旗舰档:DeepSWE 约 80%,对比 Fable 5 的约 65%、GPT-5.6 的约 52%。不同测试口径的结果并不一致:科技分析师 Chubby(@kimmonismus,13.6 万关注者)8 月 22 日转述 Ben Davis 对 Ox Alpha 的完整 DeepSWE 测试,称其整体与 GPT-5.6 Sol mid「大致持平」()。他在帖子里推断,若 Ox Alpha 真是 GLM-5.3 Flash,意味着「能以电力成本在本地运行接近前沿的模型」,是「game changer」。
档位问题正是传闻的分歧点。8 月 23 日 14:33 UTC,比取证帖早约 3 小时,agent 开发者 Dan McAteer(@daniel_mac8,约 2.9 万关注者)发帖称「Ox-Alpha 就是 GLM 5.3 Flash,我信任的朋友确认了这一点」,并称本周发布将是个惊喜("a revelation")()。这条没有可核实出处的单一信源传闻,与旗舰判定直接冲突。
结论仍是「verdict」:官方未确认,社区可复现
mrclbschff 自己把结论称为 verdict(判断)。他还在回复中直接 @Z.ai 官方账号:「实际上,我没有看到 Flash 的证据」();并在另一条帖子里坦言,私心希望 Ox Alpha 是被蒸馏过的 GLM-5.3、能在普通硬件上跑起来()。
截至 Bloomberg 8 月 23 日报道,创建者身份仍是谜。Documenting AGI(约 6.6 万关注者)同日晚间汇总时,Ox Alpha 在 OpenRouter 上依然「没有列出所有者」,只有 GLM 风格的 tokenizer 和「关于 Google 或 Z.ai 的猜测」()。也就是说,身份判断目前仍停留在社区推测层面。
这份取证的价值在于把推测变成了可检验的假说:错误码、响应 ID、tokenizer 和吞吐数据都写在帖子里,任何开发者都可以逐项核对。在智谱或 Z.ai 给出官方说法之前,复现帖子里的指纹,是这场身份悬疑目前最具体的下一步。