AREX Feed Article
Hy4 preview 接入 WorkBuddy 首日即排队,腾讯混元紧急扩容推理集群
8 月 31 日,腾讯混元官方发布公告:8 月 28 日接入 WorkBuddy 的 Hy4 preview,上线首日就在平台任务队列中出现排队,官方为此致歉,宣布已对 Hy4 preview 推理集群紧急扩容,并将持续动态调配资源。
Hy4 preview 是腾讯 8 月 28 日发布并开源的新一代旗舰模型,总参数 770B、每次推理激活 49B,上下文达到 1M,发布当天同步接入 WorkBuddy、CodeBuddy、元宝和 ima,并在 WorkBuddy、CodeBuddy 提供两周免费体验。
上线首日即排队,官方道歉并紧急扩容
公告原文称:“Hy4 preview 上线首日即在 WorkBuddy 任务队列中出现排队情况,对此我们深表歉意。”官方把原因归结为模型 Agent 能力提升带来的调用激增,并宣布两项措施:对推理集群紧急扩容,持续动态调配资源。
公告同时承认,“受限于高端算力总量与高峰并发集中,仍不排除个别时段会继续出现排队情况”。
BlockBeats 转述的同一份公告(由 WorkBuddy 与混元联合项目团队发布)口径一致:上线仅 3 天,WorkBuddy 已因高峰并发出现排队;团队正在紧急扩容推理集群,并会根据使用量继续动态增加资源,即使扩容后部分时段也可能继续排队。
对排队的用户,官方给了两个过渡方案:切换到 Hy3 等其他模型继续使用,Hy3 当前在 WorkBuddy 的限免将延长至 2026 年 9 月 30 日 23:59;非紧急需求错峰在晚间时段使用。
每日免费额度有限,多模态任务自动切换
本次公告把 Hy4 preview 的限免规则细化。限免截止 9 月 10 日 23:59,但因资源有限,平台为每位用户分配每日免费额度,触发限频后页面会提示重置恢复时间。
公告还划清了能力边界:Hy4 preview 是大语言模型,暂不具备图像/视频等多模态生成能力。用户在 WorkBuddy 发起生图、视频等多模态任务时,系统会自动切换到其他多模态模型执行,该部分按正常规则消耗积分,不占用 Hy4 preview 免费额度。
对比 8 月 28 日发布时的说法(WorkBuddy、CodeBuddy 免费开放两周),本次公告给出了确切截止时刻,并新增每日免费额度限制。Hy3 限免延长至 9 月 30 日在发布当天已经宣布,本次作为过渡方案再次重申。
770B 参数的模型,为什么上线就挤爆队列
排队为什么发生,官方只给了归因:高端算力总量与高峰并发集中。公告没有公布排队规模,也没有给出扩容完成时间。
模型本身对算力的要求是明摆着的:总参数 770B、激活参数 49B、上下文 1M 的 MoE(混合专家)架构,推理部署需要大量高端加速卡。腾讯混元称,Hy4 preview 在模型尺寸、上下文长度和数据规模上均显著扩展,并通过预训练与后训练能力提升增强智能水平,“稳居开源模型第一梯队”。这是腾讯自己的说法,媒体仅作转述。
费用端已经公布。快科技转述的 API 计费为每百万 token 输入缓存命中 0.3 元、普通输入 6 元、输出 18 元;腾讯英文新闻稿发布的美元口径是输入 0.834 美元、输出 2.501 美元、缓存命中 0.042 美元。按官方说法,Hy4 preview 已经开源,并上线腾讯云 TokenHub 和 OpenRouter。
扩容何时完成没有时间表
排队规模、扩容进度,目前只有腾讯单方说法:快科技与 BlockBeats 的报道均转述官方公告,没有第三方数据。官方给出的应对只有两个过渡方案(切 Hy3、错峰晚间),以及“不排除继续排队”的预告。
排队之外,国产算力厂商已抢先行动。海光信息 8 月 30 日宣布,旗下深算 DCU 率先完成 Hy4 preview 的 Day 0 适配,模型发布当天即完成推理全流程支持;这是继 Hy3、Hy-MT2 之后海光 DCU 与腾讯混元系列模型的又一次协同。适配在 vLLM 推理框架中接入 FlashMLA 算子,覆盖 Attention Sink、KV Cache 及并行切分,支持深度推理与直接回答两种模式和多工具并行调用。 该声明由海光单方发布,媒体转述。