AREX Feed Article
vLLM 证实三方联合调查 GLM-5.3-Flash 表现回落
8 月 30 日,开源推理引擎 vLLM 在 X 上证实,围绕 GLM-5.3-Flash 上线后表现回落的调查由它和 Inferact、Fireworks AI 三方共同完成。vLLM 官方账号在推文中写道:「我们与 Inferact 和 Fireworks AI 一起参与了这次调查。我们共享同一把标尺(bar)以保证一致性」,并分别感谢 Fireworks AI「额外花时间验证」、感谢 Z.ai「快速推送 API 更新」。
在 vLLM 表态之前,Z.ai 方面只给出过自己的口径。GLM-5.3-Flash 于 8 月 26 日发布,是 320B 总参数、18B 激活参数的 MoE 模型,官方称其此前以 Ox Alpha 名义预览。 发布博客进一步写明,模型发布前以 ox-alpha 的匿名身份在 OpenCode 和 OpenRouter 上测试收集用户反馈,并成为当周最热门模型。 8 月 28 日,Z.ai 的 Lead Zixuan Li 发文称前一天已为 GLM-5.3-Flash 推送配置更新以改善部分 agentic 用例的性能,并请「8 月 26 日至 27 日期间在你们工作流中表现不及 Ox Alpha」的用户重试并反馈体验。
三方共享同一把评测标尺
vLLM 的推文发布于 8 月 30 日 03:19(UTC),即北京时间 30 日上午。推文没有点名 GLM-5.3-Flash,只称「这次调查」(the investigation),但结合同期各方公告可以对应上:Fireworks 前一天刚解释了自己为何推迟 GLM-5.3-Flash 的上线,Z.ai 两天前宣布了配置更新。截至核验时,这条推文获得约 1.25 万次浏览、124 个赞。
三个参与方各自有可核实的动作:vLLM 是开源推理引擎,GLM-5.3-Flash 发布当天就提供了 day-0 支持,并验证了 NVIDIA 与 AMD GPU 上的运行; Inferact 是 vLLM 核心维护者 Simon Mo 任 CEO 的推理服务公司; Fireworks AI 的平台托管同一份开放权重,其模型页显示 GLM-5.3-Flash 的 Provider 为 Z.ai,按 token 计费提供服务。 而 Z.ai 自己的官方 API 则基于另一套 serving 栈:发布博客写明,团队为这套架构在 SGLang 之上构建了专门的推理引擎。
用户拿来对比的参照,正是匿名预览期的表现。Z.ai 在发布博客中贴出的 OpenRouter 数据显示,8 月 20 日至 25 日,ox-alpha 以 23.2T tokens 的消耗量排在平台第一,远超第二名 deepseek-v4-flash 的 9.9T。
Fireworks 为说不清的长度差压了两天
这场调查目前最具体的可见后果来自 Fireworks。8 月 29 日,Fireworks 宣布 GLM-5.3-Flash 在其平台 GA(正式可用),并在推文中解释了延误:「我们为了一个解释不了的长度差(reasoning-length gap),把它压了两天。同样的权重 ≠ 同一个模型。质量优先。」 这句话与 vLLM 感谢 Fireworks「额外花时间验证」相互印证:验证的内容,很可能就是同一份权重在不同 serving 环境下产出的推理长度不一致。
推理长度是这类模型的可配置项。vLLM 的 GLM-5.3-Flash recipe 文档写明,模型「思考始终开启」,长度由 reasoning_effort 字段控制,默认取 max; 同一权重在不同引擎、不同默认参数下产出不同长度的推理,并不需要模型本身有任何变化。
社区观察:分数没变,变的是推理长度
社区里最具体的观察来自 vLLM 推文下的回复。X 用户 okimraise.eth(自称跟踪 AI、初创公司与前沿科技)写道:「有意思的不是 Fireworks 推迟上线 Flash。官方 Z.ai API 才是 short-think 的离群点,他们打补丁之后,vllm/sglang 的输出长度就一致了。分数从头到尾都一样。」 这个说法把「回落」限定在了推理长度而不是得分上,但它是第三方观察,没有数据支撑。
对「为解释不了的差距推迟上线」这件事,多数回复持肯定态度。X 用户 Flextor97 说:「为了一个解释不了的基准差距推迟发布,很少见,大多数人直接就发了。」 也有唱反调的。X 用户 AllianceDouble 写道:「联合调查就是一场多方参与、没人指摘的事后复盘,把一次 API 补丁做成了公关。」
两条引用推文把机制说得更直白。OrchestriAI 创始人 Shariq Riaz 说:「相同的开放权重不代表相同的 token 消耗。引擎级的思考惩罚和解码默认值,可能在你从生产日志里发现之前就翻倍了推理 token。」 X 用户 AI Quanting 则解释为什么这类差异不会反映在准确率上:「两倍的思考仍然产出正确答案,所以它永远不会体现在准确率上,只会体现在与参照对比的 token 数量上。」
配置更新改了什么,至今没有公开
三方都没有披露调查和修复的具体内容:配置更新改了什么、生效范围多大、那把「标尺」如何定义、有没有任何性能数据,全部未公开。目前能确认的只有当事方口径:Z.ai 说 8 月 27 日推送了配置更新;Fireworks 说压了两天、验证后上线;vLLM 说三方共享同一评测标准。这些说法都未经独立验证。
技术疑问同样来自社区。Arcyton 创始人 Adam Arcyton 在回复里追问:「最后是什么让问题可复现的,工作负载还是配置?」 X 用户 ipezyGJ 问得更细:「这里有没有明确的容差,还是差距大到无法忽视?」 截至核验时,这两条提问都没有收到当事方的公开回复。
对用户来说,目前能做的仍是 Zixuan Li 在 8 月 28 日推文里留下的那一步:重试。他在结尾写道,如果 8 月 26 日至 27 日期间模型在工作流中表现不及 Ox Alpha,「请再试一次,并告诉我们体验是否改善」。