AREX Feed Article
94 分钟八条官宣:Qwen3.8-Max 同日开服七家推理平台
北京时间 8 月 14 日 23:24,@Alibaba_Qwen 发出当晚第一条开服公告。此后 94 分钟里,官方账号连发八条推文,宣布 Qwen3.8-Max 在 Together AI、Fireworks、Nebius Token Factory、Modal、DigitalOcean Serverless Inference、DeepInfra 与 SiliconFlow 七家平台同日上线,另有一条宣布模型已在 TokenSpeed 上规模化运行。
这轮官宣距开放权重发布两天。Qwen3.8-2.4T-A95B 总参数 2.4T、激活 95B,8 月 12 日上线当天,。Qwen3.8-Max 是在同一权重上加入视觉输入、非思考模式与默认 1M 上下文的官方版本;称,这是 Qwen 首次把 Max 级模型做开放发布。
23:24 到 00:58:八条官宣逐家落位
八条推文的措辞并不一致。23:24 最先官宣的是 :"2.4T parameters, 95B active, 1M context — all together now",官方称其为 Day 0 launch partner。
23:26 的 上线,定位 "ready for agents, heavy coding, and long-context work",同为 Day 0 launch partner。23:28 的 是七家里唯一用将来时的:"coming to Nebius Token Factory on Day 0",主推 dedicated inference。23:32 的 写明 "full 1M context window and a custom DFlash speculator"。23:35 的 落在 Serverless Inference 上,"Big model. Smooth sailing."。
前五条挤在 23:24 到 23:35 的 11 分钟里,后三条跨过午夜:00:27 的 只说 "now live"、一次 API 调用即可,没有 Day 0 字样;00:50 的 用了 "served fresh on Day 0";00:58 收尾的是 :"running at scale … Light on latency, big on speed",并感谢 LightSeek 的 Day-0 支持。七家里只有 Together、Fireworks、Nebius、Modal、DigitalOcean 五家被正式称为 Day 0 launch partner;SiliconFlow 与 DeepInfra 两条用的是权重名 Qwen3.8-2.4T-A95B,其余五家用 Qwen3.8-Max。
Modal 与 Together 在 8 月 12 日就动了手
官方公告集中在 8 月 14 日,但两家平台的动作更早。Modal 的日期是 8 月 12 日,标题就叫《Qwen3.8-2.4T-A95B now available on Modal》。文中说,团队在权重落地前就与 Qwen 合作,把 Day-0 支持做进 Modal Auto Endpoints,底层用 SGLang,另配一个按 Qwen3.8 形状定制的 DFlash speculator。
模型以 OpenAI 兼容的 Shared Endpoint 上线,按 token 计费。博客页面描述写明"带 1M token 上下文窗口",Qwen 官宣同样写了 "full 1M context window"。
Together AI 8 月 12 日也,宣布 Serverless Inference 提供运行 Qwen3.8-2.4T-A95B 的托管高吞吐路径。其把规格写成:2.4T 总参数稀疏 MoE、上下文窗口 256K、单次输出上限 128K token,99.9% SLA,serverless 与 dedicated 两种形态,API 模型名为 Qwen/Qwen3.8-2.4T-A95B。这里有一处对不上:Qwen 给 Together 的官宣写 "1M context",Together 页面标的是 256K。
同一份权重,七种卖法
七家平台在同一份 2.4T 权重上押了不同卖点。Modal 押长上下文与速度:完整 1M 上下文加定制 DFlash speculator,官宣原话是 "2.4T parameters. 1M context. Somehow, still just a Modal call away."。Modal 博客解释,speculator 只有在草稿 token 被主模型接受时才有收益,所以团队把 Max 在编码、研究与工作场景里频繁出现的工具调用序列放进训练数据,提高接受率。
Nebius 押专属推理,称要把 dedicated inference 带给更多用户。DigitalOcean 押 serverless,Fireworks 面向智能体、重度编码与长上下文负载。
七家之外,还有一条宣布模型已在 TokenSpeed 上规模化运行、低延迟高速度;Hugging Face 模型卡也把 TokenSpeed 与 vLLM、SGLang 并列,列为这套权重的兼容推理栈。SiliconFlow 与 DeepInfra 的差异化则在门槛上:前者是 "From idea to implementation in one go",后者强调一次 API 调用即可拿到 Max 级智能、面向创意构建。
价格、延迟与上下文:推文没写的数字
八条官宣没有一条给出价格或延迟数字。可参照的是 Qwen 官方 API 的价格:输入每百万 token 2 美元、输出 6 美元、隐式缓存 0.25 美元,这是 ;模型卡同时注明,官方 API 服务由 Qwen Cloud 提供。第三方平台的账单要逐家核对:Modal 博客只写了 token-based pricing,没有单价。
还有两处要等平台自己补全。Nebius 的公告用 "coming" 而非 "live",上线时刻未写明。上下文窗口方面,Qwen 给 Together 的官宣写 1M,Together 页面标 256K,Modal 明确给完整 1M。八条推文已经把入口铺开,但每个入口放出多少上下文、收多少钱、延迟多低,答案不在官宣里。