AREX Feed Article
畸形请求炸出 Java 类名:Ox Alpha 服务层指向 Z.ai
8 月 22 日下午,两条相互独立的取证先后指向同一结论:OpenRouter 匿名模型 Ox Alpha 由 Z.ai(智谱)提供服务。AI 爆料/安全测试账号 Chetaslua(3.2 万粉)在 16:52(北京时间,下同):向 OpenCode 的 x-preview-f-free 端点发送一个畸形请求,服务器抛出 Java 堆栈,泄露内部类名 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest,与智谱文档化路由 /api/paas/v4/chat/completions 一致。"这不是指纹猜测,是服务器自己招供,服务层实锤,confidence 0.98。"16 分钟后,中文账号 SuSu_酥酥(@NFT_Chen,1 万粉):同样的类名、与 OpenRouter pinned 的 glm-5.x 100% 匹配的错误码方言、DeepInfra 对照组和 30/30 的 tokenizer 探针,结论是"从'猜是 GLM 家族'正式升级为'服务层实锤'"。两份取证均为社区测试推断,智谱与 OpenRouter 均未作官方确认。
背景:Ox Alpha(stealth/ox-alpha)8 月 20 日由 OpenRouter 上线,免费一周,104.8 万 token 上下文,支持文本/图像/视频输入,OpenCode 宣称为其准备了每日 100 万亿 token 容量()。此前身份判断基本来自输出层"指纹":分词器与 GLM-5.3 恒定差 75 token、视频视觉 token 消耗与 GLM-5V-Turbo 完全一致,Ben Davis 据此给出约 99% 属 GLM-5.x 的推测()。新取证不再比较输出,而是直接观察服务器行为。
一个畸形请求,服务器自己"招供"
Chetaslua 的测试无需 API key 即可复现:向 opencode.ai/zen/v1/chat/completions 发送 {"model":"x-preview-f-free","top_p":"abc"},把 top_p 传成字符串。他的取证信息图拆解了泄露路径:同一请求走 OpenRouter 会在边缘校验被拦下,到不了上游;OpenCode 不校验、原样代理,上游的 Java(Spring/Jackson)服务在解析请求时报错,堆栈带出完整类名。类名包路径对应智谱 PaaS v4 聊天接口,即官方路由 /api/paas/v4/chat/completions。
SuSu_酥酥 独立复现出相同类名,并补充:测试端点无需 key;tokenizer 30/30 探针全中 GLM-5.3,是"典型 post-train,不是新预训练",即权重是对 GLM 家族基座的继续训练产物。
错误码方言:换一家运营商,报错就不一样
SuSu 的第二项证据是错误码方言。向 Ox Alpha 发送 role:"wizard" 返回错误码 1214;非法 temperature 返回 1210,附带全角冒号和中文提示"限制数值范围[0,1]",与 OpenRouter 上 pinned 的 glm-5.3、glm-5.2、glm-5v-turbo 三个模型 100% 一致。这套四位错误码不在 OpenAI 兼容接口的通用方言里。
关键是对照组:同一份开源权重部署在 DeepInfra 上,同样的请求抛出的却是不同的 pydantic 错误。错误码方言属于"运营商"而非"权重",它证明的是谁在跑服务,而不是模型是谁。这是服务层取证区别于以往指纹分析的地方。
全量 DeepSWE 实测 58.4%,流传的 80% 被纠正
同一天 15:33,Cohere 推理工程师 Henry Zhang :完整跑完 113 个任务的 DeepSWE 端到端评测,Ox Alpha 实际通过率 58.4%,与 Claude Opus 4.8(59%)几乎持平,"此前流传的约 80% 通过率完全不正确"。评测存档在:66/113 任务解决,耗时 20 小时 39 分,工具链为 pier 0.3.1 + mini-swe-agent。README 还记录两个细节:80% 的任务通过了九成以上的 fail-to-pass 测试;另有 9.7% 的失败来自工具调用格式错误,而非推理本身。
80% 的说法来自开发者 Ben Davis 用 10 个任务做的小样本测试。报道,另一位开发者在不同 DeepSWE 子集上测得约 63%,两次测试任务范围与配置不同,无法据此定级;DeepTech 也确认 DeepSWE 官方排行榜尚未收录 Ox Alpha。纠偏后,Ox Alpha 的定位从"碾压头部模型"回到"与 Opus 4.8 同级"。
身份之争没有结束:Baseten、传闻与排除法
服务层证据指向智谱,但窗口内仍有三种说法并存。Spearbit/Cantina Security CEO Hari 在 14:06 :逆向识别出 Ox Alpha 是 @baseten 托管的 GLM-5.2-Vision 或其衍生版。第三方托管与 Z.ai 自有 PaaS 直连是两种不同的服务拓扑,该帖未附完整证据链。
DeepSeek 圈知名账号 Teortaxes(7.2 万粉)在 11:00 :称"消息非常灵通的人士(包括前沿实验室内部)"认为 Ox Alpha 是基于 GLM 5.2 的新版 Cursor Composer,即西方实验室拿中国开源基座做后训练。这是纯匿名传闻,与"智谱直接发布"的主流推测相左。
排除法也在推进:Roboflow 开源负责人 Piotr Skalski 在 18:34 用航拍/卫星图像做视觉测试后,称 Ox Alpha 视觉能力"至多平庸"。机器之心在 18:44 发稿时称,OpenRouter 与智谱都没有公开回应。
无论最终归属谁,服务层取证把这场猜谜从"模型像谁"推进到"服务器是谁的"。按 DeepTech 的梳理,此前四款 OpenRouter 匿名模型(Pony Alpha=智谱 GLM-5、Hunter Alpha=小米 MiMo-V2-Pro、Elephant Alpha=蚂蚁 Inclusion AI、Owl Alpha=美团 LongCat-2.0)最终均确认为中国团队;若服务层确为 Z.ai,这将是智谱第二次用匿名马甲测试新模型。官方公布之前,身份仍是推断;按以往匿名模型的发布节奏,免费测试预计在 8 月 27 日前后结束(DeepTech)。