AREX Feed Article
腾讯混元开源 Hy4 预览版:770B 总参数、49B 激活、1M 上下文
UTC 时间 8 月 28 日 6 时 23 分(北京时间 14 时 23 分),腾讯混元官方 X 账号 @TencentHunyuan 宣布推出 Hy4 预览版(Hy4 preview):总参数 770B,每个 token 激活 49B 参数,上下文窗口 1M。官方把这款模型定位为"为生产力而建"(Built for productivity),同时给出两个承诺:"开源前沿"(Open source frontier)和"一致且可负担的价格"(Consistent affordable price),并在推文末尾附上官方博客、HuggingFace 与 GitHub 链接,留下一句"用起来,告诉我们哪里坏了"(Use it. Tell us what breaks.)。
同一天,跟进给出更细的口径:Hy4 preview 的上下文窗口"超过 1M token",API 按量计价,输入每百万 token 0.834 美元,发布当天在 WorkBuddy 与 CodeBuddy 免费开放两周。权重当天已上架 与 ,官方博客地址为 。
770B 里只动 49B:Hy4 预览版的 MoE 骨架
按模型卡的说明,Hy4 preview 是腾讯 Hy 团队(Tencent Hy Team)开发的新一代 MoE 旗舰模型,主干共 78 层:第一层使用标准稠密 FFN,其余 77 层换成 MoE,每层 256 个路由专家加 1 个共享专家,每个 token 激活其中 top-8 路由专家和共享专家。
架构上有两处关键设计:注意力模块采用 Gated DeepSeek Sparse Attention(Gated DSA),配 IndexCache 做跨层稀疏索引复用;残差通路改用 iHC(identity Hyper-Connections)扩大层间信息流动。模型卡注明这两处"受 DeepSeek 与 GLM 启发"。
主干之外,模型内置 1 个原生 MTP 层(10B 总参数、0.7B 激活),用于投机解码(speculative decoding)加速。官方推荐用 vLLM 或 SGLang 部署,两个框架都提供了官方预构建镜像,FP8 量化版(Hy4 preview-FP8)权重也一并开源,官方示例以 8 卡张量并行启动。规格表里,hidden size 6144、64 个注意力头、4 条残差流,上下文长度 1M。
163 名内部专家、203 个任务:一场针对生产力的盲评
训练数据是这次定位的关键。官方称,他们与腾讯内部的软件工程师、游戏开发者、金融分析师和安全专家合作,围绕这些团队实际交付的工作构建训练数据,并与 CodeBuddy、WorkBuddy 等产品做联合设计(co-design)。
四个主打场景写进了模型卡:软件工程(长程开发任务的理解、规划、调试与验证)、办公与分析(把散落多文件的内容整理成文档、表格和演示稿)、游戏开发(一句提示词生成可玩原型)、科学研究(AI 研究、分子动力学、凝聚态物理与基础数学)。
为了验证"生产力"卖点,腾讯做了一场内部盲评:163 名内部专家给 203 个工程任务的输出打分,Hy4 preview 平均 2.99 分,略高于 GLM 5.3 的 2.92(46.8% 胜率、12.8% 平局)和 Kimi K3 的 2.94(51.2% 胜率、7.9% 平局)。这是厂商自评口径,不是独立测评。
Apache 2.0 权重四平台上架,输入每百万 token 0.834 美元
开源是这次发布的关键动作:Hy4 preview 与 Hy4 preview-FP8 的权重以 Apache 2.0 许可,在 Hugging Face、ModelScope、GitCode、CNB 四个平台同步开放下载。
价格上,腾讯给出的 API 报价是输入每百万 token 0.834 美元、输出 2.501 美元、缓存命中 0.042 美元;接入渠道包括腾讯云 TokenHub 与 OpenRouter,WorkBuddy、CodeBuddy、Yuanbao、ima 等腾讯产品内可直接使用。发布当天,WorkBuddy 和 CodeBuddy 上 Hy4 preview 免费两周,上一代 Hy3 在两个平台上的免费期延长到 9 月 30 日。
"一致且可负担的价格"是官方反复强调的承诺。腾讯 AI 官方新闻账号 转发时补了一句:"我们只升级,不涨价"(We ship upgrades, not price hikes)。
上线首日:Arena 给出 AutoEval 第 5 名,社区开始实测
独立评测平台 在官宣后几分钟内给出初步排名:Hy4 preview 在 Code Arena: WebDev 上以 1633 分(AutoEval)列全球第 5,比上一代 Hy3 的第 31 名提升 115 分;在开源模型里排第 3,Hy3 当时是第 7。Arena 同时提醒,这是早期 AutoEval 分数,由基于人类偏好数据训练的打分模型代投,会随真人投票增加而收敛。腾讯官网新闻列表显示,Hy3 于 7 月 6 日正式发布,与本次相隔不到两个月。
在另一条推文里写道:"这个位置现在很挤了,我们喜欢这样"(Crowded up here now. We like it that way.)。在 PrimeIntellect 负责评测的 Florian Brand()评论称,报告的分数"大致与 GLM-5.3 持平"。
拥有 16.8 万粉丝的 X 用户 对比称,上一代 Hy3 是 295B 总参数、21B 激活,Hy4 preview 相当于一代内翻了 2.5 倍,还称其编码成绩超过 GPT-5.6 Sol。这些数字出自他的个人推文,不是腾讯官方数据。另一位用户 直接动手实测:在 WorkBuddy 里把模型切到 Hy4 preview,"能用"。
截至 UTC 8 月 28 日 12 时前后,官宣推文已累计超过 44 万次浏览、约 3400 次点赞。
"告诉我们哪里坏了":预览策略、已知缺陷与下一批模型
Hy4 preview 名字里带着 preview,官方也明确列了已知缺陷:处理复杂任务时推理耗时偏长,且倾向于过度自我验证(over-verify);预训练与后训练都还有余量。模型卡把策略说得很直白:和 Hy3 preview 一样,宁可早发,听大家报告哪里坏了,Hy3 就是这么变好的。
这次发布还出现了"模型参与优化自身"的环节。腾讯新闻稿称,Hy4 preview 首次参与了对训练方法、数据策略、评估框架和底层算子的自动化优化,自己提方案、跑实验、按结果迭代,形成一条初步的递归自我改进闭环;它还自主分析推理系统瓶颈,做算子融合与通信优化,把端到端吞吐量比基线提升 31.8%。
自改进与 31.8% 的吞吐提升均出自腾讯新闻稿。官方给出的下一个节点是:Hy4 系列的下一批模型预计很快推出。