AREX Feed Article
Kingbench 87.5% 首测出炉:Ox Alpha 紧咬 GLM-5.3,100 万亿 token 免费容量遭算力质疑
8 月 21 日,给匿名模型 Ox Alpha 贴上了上线以来首个见诸报道的量化成绩:在第三方排行榜 Kingbench 上拿到 87.5%,仅次于 GLM-5.3 的 91.25%。同一篇报道引用了社区用户 Teortaxes 的算力账:按 DeepSeek V4 级别的推理效率,OpenCode 宣称的"每天 100 万亿 token 免费容量"需要约 58 万个"GPU"才能撑起。
8 月 20 日,"新 stealth 模型 Ox Alpha",称它面向高效编程、长时间 Agent 任务和真实生产环境。模型由一家"选择在预览期保持匿名的第三方供应商"开发运营,显示:100 万 token 上下文、最大输出 131,072 token、支持文本/图像/视频输入、仅文本输出、定价免费,8 月 20 日上线。模型参数、训练数据和开发团队全部保密;当时明确写道,OpenRouter 没有公布任何 SWE-bench、Terminal-Bench 或其他编程与 Agent 基准成绩。
Kingbench 87.5%:匿名模型第一次被量化
据 wccftech 报道,在 Kingbench 等第三方排行榜上,Ox Alpha 拿下 87.5%,排在 GLM-5.3(91.25%)之后。这是该模型上线以来第一个见诸报道的第三方排行榜成绩。
wccftech 把这个分数和既有指纹证据并置:Ox Alpha 的视频编码管道、分词器数学和逐字符响应风格都与智谱的 GLM 架构高度相似;GLM-5.3 公开端点没有原生视觉、视频能力,Ox Alpha 却主打文本/图像/视频输入。报道据此推断,如果模型确系智谱出品,它应是"未发布、大幅升级的 GLM 级模型",而非现有型号改名。报道还提到,智谱有匿名测试先例(GLM-5 曾以 Pony Alpha 名义灰度),且运行着多个万卡集群、刚启用一座 1GW 数据中心。
中文侧另有一组小样本测量。36氪报道了用户对 Ox Alpha 与 Fable 5、GLM-5.3、GPT-5.6 Sol、Grok-4.6 的 10 项任务对照:Ox Alpha 通过 8 项(80%),高于 Fable 5 的 65%、GLM-5.3 与 Grok-4.6 的 62%、GPT-5.6 Sol 的 52%。但原测评作者提醒,样本太小、测试口径不一致,"不能直接判断它已经击败 GPT、GLM 或 Fable"。36氪也强调,OpenRouter 用了"frontier model"定位,但当时没有公开证据证明 Ox Alpha 进入第一梯队。
100 万亿 token 的算力账:约 58 万 GPU
这轮测试的另一项承诺是免费。据 36氪,OpenCode 宣布 Ox Alpha 在其平台免费开放一周,准备了"每天 100T(万亿)token 的容量",OpenCode 联合创始人 Dax 在 X 上向开发者喊话:"快来猜猜是啥模型吧!"
被质疑的正是这个容量口径。长期跟踪 DeepSeek 的社区用户 Teortaxes(@teortaxesTex)8 月 21 日算了一笔账:即使按 GLM-5.3 规模模型以 DeepSeek V4 的效率运行,每"GPU"每秒约 2000 token、推理速度 80 tps 上下,"按这个速度,100T/天需要约 58 万'GPU'"。他补了一句:"要么他们指的不是输出 token,要么……就是些不太可能的事。"
wccftech 引用了这笔账,判断更折中:智谱确实拥有多个万卡集群和刚启用的 1GW 数据中心,有能力每天免费提供 100 万亿 token。同一个论证里,报道顺带排除了两家被猜得最多的厂商:DeepSeek 最近上调了 V4-Flash 价格,看起来没有余力支撑这种吞吐;SpaceXAI 算力充足,但 Ox Alpha 在高度敏感的中国政治议题上表现出的政策边界,暗示模型用中国大陆数据训练。
分词器指纹打架:智谱之外冒出微软 MAI
围绕分词器的分析出现了两套相反结论。中文社区此前的测试认为 Ox Alpha 与智谱最接近:25 个提示中原生 token 数量与 GLM-5.3 完全匹配,50/50 对抗字符串测试中与 GLM-5.3 匹配度最高,Gemini、DeepSeek、Kimi 只有 18%–22%(36氪)。
wccftech 在报道更新中引述用户 Robert Lukoszko(@Karmedge)的判断则完全相反:Ox Alpha 用的是 cl100k_base 分词器,这是 OpenAI 开发的 BPE 分词器,"排除了 OpenAI、Google、Anthropic、xAI 以及每一家中国前沿实验室,只匹配微软的 Phi/MAI 谱系",据此认为 Ox Alpha 最有可能是微软未发布的 MAI 2。wccftech 自己也承认,目前围绕 Ox Alpha 的分析变化很快。同一种技术指纹,两套相反结论;截至两篇报道发出时,没有任何一种猜测获得证实(36氪)。
OpenRouter 征集反馈,身份仍未揭晓
8 月 21 日,向社区征集意见:"大家怎么看???模型实验室应该改进什么?它真正强在哪里?"截至检索时,这条推文有 1400 多个赞、158 条回复。模型页面能确认的只有规格:免费、100 万 token 上下文、131,072 输出上限、8 月 20 日上线;供应商身份仍标注为匿名。
按照 OpenCode 的承诺,免费窗口持续一周。窗口期内能被持续检验的,只有 Kingbench 87.5% 这个分数和"100T/天"对应的约 58 万"GPU"算力账。