AREX Feed Article
腾讯混元官宣 Hy4 preview 接入 Cline,SWE-bench Pro 暂列第一
北京时间 8 月 29 日 10:34,腾讯混元官方账号 @TencentHunyuan(显示名 Tencent Hy,商业认证)发出:"Try Hy4 preview in Cline"——前一天 14:23(北京时间)发布的 Hy4 preview,现在可以直接在开源编码代理 Cline 中使用。这条推文发布于 UTC 时间 8 月 29 日 02:34,距约 20 小时。
这轮接入并非腾讯单方面宣布。UTC 8 月 28 日 18:12(北京时间 8 月 29 日 02:12),已先一步公告:"Tencent Hy4 Preview leads on SWE-bench Pro"(腾讯 Hy4 Preview 在 SWE-bench Pro 上领先),并给出三步用法:npm i -g cline 安装、输入 /model、选择 Hy4 preview。公告配图是一张 SWE-bench Pro 对比图,标注"数据由腾讯报告":Hy4 preview 65.7%,GPT 5.6 Sol 与 GLM 5.3 各 64.6%,Kimi K3 63.3%,DeepSeek V4 Pro 60.3%。
Cline 抢先官宣,腾讯官方 20 小时后确认
Cline 在公告里给了两个判断:这是"测到的最大代际提升"(biggest generational leap measured to date),也是"又一个与前沿模型同场竞争的开源权重模型"。Cline 的账号简介自称"The open source coding agent that takes over your editor, terminal, and browser to complete work autonomously"——接管编辑器、终端和浏览器、自主完成工作的开源编码代理,覆盖 VS Code、JetBrains 和 CLI,账号有 7.6 万关注者,商业认证。
腾讯混元的确认推文只有一句话,没有附带链接、截图或定价说明。Cline 先于腾讯官宣这个顺序说明,接入由 Cline 一侧落地:它已经给出了在模型选择列表里找到 Hy4 preview 的操作路径,官方账号随后跟进确认。
770B 总参数,每个 token 只激活 49B
Hy4 preview 是腾讯 Hy 团队的 MoE 旗舰模型。显示:总参数 770B,每个 token 激活 49B。骨干共 78 层,第一层为稠密 FFN,其余 77 层各含 256 个 routed expert 和 1 个 shared expert,每个 token 激活 top-8;另有一个原生 MTP 层(10B 参数、0.7B 激活)用于投机解码。注意力采用受 DeepSeek 与 GLM 启发的 Gated DeepSeek Sparse Attention,配合 IndexCache 做跨层稀疏索引复用,残差通路用 iHC(identity Hyper-Connections),上下文长度 1M。
模型以 Apache License 2.0 发布,权重同时开源在 Hugging Face、ModelScope、GitCode 和 CNB,含 FP8 版本。腾讯在模型卡中自述,这是"我们测到的最大代际提升",足以把 Hy4 preview 放到开源前沿;与 GLM 5.3、Kimi K3 的对比来自内部盲评:163 名内部专家给 203 个工程任务打分,Hy4 preview 平均 2.99,高于 GLM 5.3 的 2.92 和 Kimi K3 的 2.94。模型卡同样列出了已知问题:复杂任务上推理耗时偏长,且倾向过度自我检查。
发布推文配的是一张 12 项基准对比图:Hy4 preview 与 Hy3、Qwen 3 8x Max、DeepSeek V4 Pro 0813、GPT 5.6 Sol、GLM 5.3、Kimi K3、Claude Opus 5 同场比较,蓝色高亮为 Hy4 preview。截至 8 月 29 日核验时,这条发布推文已有约 142 万次浏览、4961 次点赞和 519 次转发。
发布 20 小时,模型连进三个编码入口
接入 Cline 只是这轮接入潮的一部分。UTC 8 月 29 日 02:26,腾讯混元官方账号,后者称 :"770B 总参数、每 token 只激活 49B、1M 上下文、Apache 2.0,一个你真能下载的前沿模型";一分钟后,官方账号发文确认 Hy4 preview 在 可用;七分钟后,就是那条 Cline 确认推文。
同一时间窗口里,其他开源模型也在挤进编码代理。UTC 8 月 28 日 06:41,宣布 Qwen3.8-Flash(125B/6B、1M 上下文、多模态)上线 OpenCode Go;在 Cline 的公告评论区,已有订阅用户问。开源权重模型接入编码 agent 的速度,正在成为发布当天就要见分晓的竞争维度。
1.1 分的领先,经得起一个随机种子吗
Cline 公告下的回复大致分成三类。一类看好:UnderCover Media 的 CEO Martin Ronfort 在腾讯混元确认推文下回复(太喜欢了,Hy4 一直在惊艳所有人);开发者 Ben 认为,,同一 harness、不同权重,这才是比较模型而不是比较应用的方式。
另一类盯住数据来源。 写道:"1.1 分是自报评估,前四名差距小到一个不同的随机种子就能抹掉。真正要紧的数字是 770B 里激活 49B——你仍要把整个模型装进内存,才能路由到它的十六分之一,这就是'开源权重'和'跑得动'越离越远的原因。"PNNLab 首席数据科学家 则问:超出基准 harness 之后,在真实仓库规模和工具使用下,这个增益还剩多少?柏林开发者 补了一句:开源模型以 1M 上下文领跑编码基准,这种事以前值得核实两遍,这周已经算不上新闻了。
第三类问题关于钱。用户 在 Cline 公告下问"在 Cline 里免费吗",用户 说"Hy3 免费,Hy4 不免费?"。腾讯官方 8 月 28 日 13:42(UTC)发过一条只有四个词的推文(免费两周),未说明适用范围,评论区随即出现、等抱怨;用户 说,想找 API key 接进编码工具,官网太难导航,"我直接放弃了"。
接入只是第一步,跑不跑得动才是问题
8 月 29 日 05:31(UTC),腾讯混元官方又放出回应"跑不跑得动"的一手:,命名为 MIX-STQ1_0,按校准数据逐层选择位宽(低至 1.31-bit),并给出精度对比:MCP Atlas 83.7→83.2,SWE-Bench multi 82.9→81.3,MRCR 81.3→81.1,IFBench 73.5→72.5,官方称"相对 BF16 精度几乎不动"。
在核验到的官方材料里,价格信号只有两条:发布推文里的"Consistent affordable price"(稳定、可负担的价格),以及"Free for 2 weeks"那条推文。接入 Cline 只需要三步命令;榜单上的"领先"来自腾讯自报的数据;免费期结束后的价格、接入门槛与 770B 权重在服务端和本地的落地成本,决定这个名次能换来多少真实使用。腾讯那条确认推文只有一句话,而围绕免费与跑分的提问,散落在 Cline 公告和"Free for 2 weeks"推文的评论区里。
参考链接
- _