AREX Feed Article
半年从推倒重来到 Apache 2.0 开源,腾讯 Hy3 用 21B 激活参数硬刚 2-5 倍大模型
2026 年开年以来,开源大模型赛道的主旋律只有一个字:大。DeepSeek V4 Pro 万亿参数开路,GLM-5.2 紧随其后,参数军备竞赛看不到尽头。当全行业都在用参数量定义竞争力时,腾讯混元团队在 7 月 6 日给出的答案却是——295B 总参、21B 激活,Apache 2.0 全开源,就够了。而且它不是发一篇论文、丢一组权重就完事,而是带着 50 多个产品团队两个多月的实战反馈,交出了一份"产品化修复日志"。
295B,Apache 2.0,一次没有"preview"后缀的正式交付
Hy3 正式版是一个 295B 总参数的混合专家(MoE)模型,单次推理仅激活 21B 参数,外加 3.8B 的 MTP(多 token 预测)层。模型支持 256K 上下文窗口,64 个注意力头(GQA,8 个 KV 头,头维度 128),隐层维度 4096,中间层维度 13312。专家系统配置为 192 个专家,每次推理激活 top-8。架构层面与 4 月 23 日发布的 Hy3 preview 完全一致——改动不在骨骼,而在血肉。
与 preview 版本相比,正式版有两个根本性变化。第一,许可证从"Tencent Hy Community License"升级为 Apache 2.0。这不是一次措辞调整——preview 时期的社区许可本质上是一份"试用邀请",而 Apache 2.0 意味着全球开发者可以自由商用、修改、分发,没有任何隐藏限制。第二,preview 时期那些"能用但不好用"的系统性问题——幻觉频发、工具调用不稳定、多轮对话意图丢失——在正式版中被系统性地修掉了。
同时发布的还有 Hy3-FP8 量化版本,精度为 F8_E4M3,显著降低了 GPU 显存需求。两个版本均已上线 Hugging Face、ModelScope、GitCode 和 CNB,vLLM 和 SGLang 均已提供专用部署方案。
幻觉率砍半、工具调用不再"无限循环":正式版到底修了什么
Hy3 preview 发布后,腾讯内部超过 50 个产品团队将模型接入真实业务——从 WorkBuddy/CodeBuddy 的办公和编程 agent,到元宝的 AI 搜索和对话,再到 ima 的知识库问答和 Marvis 的文件管理——在实际使用中踩出了大量 preview 版本的产品化缺陷。
正式版的改进清单,本质上是一份"产品化修复日志",每一项都对应着真实用户场景中的痛点。
反幻觉:行为准则驱动的数据治理
腾讯混元团队为 Hy3 设定了一条明确的行为准则——"有依据才回答,证据不足就明说,不混用来源,不编造数据"(answer when grounded, state when evidence is missing, do not conflate sources, do not fabricate data)。基于这条准则,团队实施了细粒度的数据清洗和专项训练约束。
在内部真实场景评测中,Hy3 的幻觉率从 preview 的 12.5% 降至 5.4%,降幅超过一半。常识性错误率从 25.4% 降至 12.7%。事实混淆、凭空捏造和逻辑矛盾显著减少。这对搜索增强和长文档理解场景尤为关键——元宝在接入 Hy3 后,基于真实用户日志的评测显示事实错误率减半。
工具调用:跨框架一致性是硬指标
preview 版本在 tool calling 场景中存在多个基线可靠性问题——工具调用成功率不稳定、错误恢复能力弱、无效调用容易触发无限循环。正式版修复后,工具调用成功率和错误恢复能力大幅提升,触发无限循环的无效调用明显下降。
更值得关注的是跨框架一致性。Hy3 在不同 agent 脚手架(CodeBuddy、Cline、KiloCode)之间的 SWE-Bench Verified 得分方差控制在 4% 以内。这意味着开发者不必为了换一个编程工具框架而重新调试 prompt——模型的 agent 能力是稳定的,不依赖特定脚手架。
长对话:从 MRCR 42.9% 到 75.1%
长对话场景中的意图衰减是多轮 agent 交互的核心痛点。通过 SFT 和 RL 联合优化,Hy3 在指代消解、省略恢复、多轮约束继承等关键能力上实现大幅提升。内部综合多轮测试的问题率从 17.4% 降至 7.9%,开放 benchmark MRCR(多轮指代消解)从 42.9% 跃升至 75.1%。输出更精炼的同时,复杂意图在长周期交互中不再衰减或漂移。
产品落地:数字不会说谎
这些改进在腾讯内部产品中的落地效果同样显著:
- WorkBuddy/CodeBuddy:任务解决率从 72% 跃升至 90%,平均任务完成时间缩短 34%。在 token 效率上,Hy3 在高频办公任务中的 token 消耗显著低于 GLM-5.2——文档处理场景节省 47.4%,PPT 制作场景节省 49.0%。
- 元宝:同步上线 Agent 功能,在综合办公和生活服务场景的内部评测中已超越 GLM-5.1。用户只需用日常对话说出需求,元宝即可直接执行复杂任务并交付 PPT、Word、Excel、PDF、HTML 等格式的文件。
- ima:知识库问答推理质量净提升近 19%。长文写作和方案生成的结构完整性和可用性显著增强,思考更具系统性,信息覆盖更广。
- Marvis Agent:任务完成率达到 93.7%,较 preview 提升 12.7 个百分点。同时调度 6 个 agent 时,任务分配准确率达到 92%,较 preview 提升 13.5%。
- WeGame《流放之路:降临》AI 助手:多轮推理和工具调度成功率升至 92%,幻觉率从 4.5% 降至 2.8%。
姚顺雨挂帅,半年走完从推倒重建到产品落地
Hy3 的故事始于一场"自我革命"。
2025 年 12 月,腾讯对内部大模型研发架构进行了大规模重组。新设立 AI Infra 部、AI 数据部和数据计算平台部,将原先分散在各业务线的 AI 能力集中整合。同时,清华姚班出身的姚顺雨(Shunyu Yao)被任命为腾讯首席 AI 科学家,向总裁刘炽平和高级执行副总裁卢山双线汇报。
姚顺雨此前在普林斯顿大学获得博士学位,是 agent 和推理领域的知名研究者,代表作包括 SWE-bench 的雏形工作。加入腾讯后的第一件事,就是在一个月内推翻现有训练框架,从零重建整套预训练和强化学习基础设施,并定下三条核心原则——"不偏科、不刷榜、不浪费资源"。
重建后的第一个成果是 4 月 23 日发布的 Hy3 preview。这个模型从开始训练到公开发布仅用三个月。preview 上线两周后,token 调用量就达到了上一代 Hy2 的 10 倍,并在 OpenRouter 上以 3.66 万亿 token 的周调用量拿下总量和市场占有率的"双料第一"。
到正式版发布时,Hy3 的日均 token 消耗量已增长 20 倍,尤其在 WorkBuddy/CodeBuddy 和 QClaw 类应用中,调用量增长超过 16.5 倍。主动选择 Hy3 的用户数在 WorkBuddy 上增长 6 倍。
从 2026 年 1 月底完成基础设施重建,到 4 月推出 preview,再到 7 月正式版交付,混元团队在不到六个月的时间里跑通了"推倒重建 → 预览验证 → 产品级价值交付"的完整闭环。这条路径的速度在国内大模型团队中尚无先例。
BrowseComp 追平 GPT-5.5,内部盲测超 GLM-5.1
腾讯为 Hy3 正式版发布了一份极为详尽的 benchmark 附录,横跨编程、搜索、工作 agent、STEM 推理和上下文学习六大领域,横向对比了 GLM-5.2、GLM-5.1、DeepSeek V4 Pro、Seed-2.1 Pro、Qwen-3.7 Max、Gemini-3.1-pro-preview、Claude Opus 4.8 和 GPT-5.5 共八款主流模型。
编程 agent:与开源第一梯队并跑
Hy3 在 SWE-Bench Verified 上拿到 78.0 分,SWE-Bench Pro 上拿到 57.9 分,SWE-Bench Multilingual 上拿到 75.8 分。在 Terminal-Bench 2.1 上拿到 71.7 分,DeepSWE 上拿到 28.0 分。
作为参照:GPT-5.5 在 SWE-Bench Verified 上得分 84.4,SWE-Bench Pro 上得分 58.6;GLM-5.2 在 SWE-Bench Pro 上得分 62.1;DeepSeek V4 Pro 得分 55.4。Hy3 与开源第一梯队基本持平,但与 GPT-5.5 为代表的顶级闭源模型之间仍存在约 6 个百分点的差距。
搜索 agent:追平 GPT-5.5
搜索是 Hy3 表现最强的领域。BrowseComp 得分 84.2,追平 GPT-5.5,在所有八款对比模型中并列第一。WideSearch 得分 76.4,DeepSearchQA 得分 91.0。这意味着 Hy3 在"从开放互联网中找到并综合信息"这一核心 agent 能力上,已经达到了闭源旗舰的水准。
STEM 推理:逼近前排
GPQA Diamond 得分 90.4,逼近 GPT-5.5 的 93.6。HLE(带工具,纯文本)得分 53.2,低于 GLM-5.2(54.7)但高于 DeepSeek V4 Pro(48.2)。USAMO 2026 得分 72.0,IMOAnswerBench 得分 90.0。在 MathArena Apex(38.7)和 SuperChem(54.9)上也交出了可观的成绩。
上下文学习:国内最高
CL-bench 是姚顺雨亲自挂帅的研究方向——他与复旦大学合作的论文于 2026 年 2 月发布,专测模型从上下文中学习全新知识并正确应用的能力。Hy3 在 CL-bench 上拿到 23.8 分。这个数字看上去不高,但横向对比:Claude Opus 4.8 也仅有 24.8 分,而论文发布时 GPT-5.1(High)在不提供上下文的情况下几乎无法解决 CL-bench 中的任何任务。Hy3 的 23.8 分,是国内模型中最高。
内部盲测:真实场景更有说服力
腾讯显然不满足于 benchmark 讲故事。正式版发布前,团队组织了一场内部盲测:270 位不同学科的专家,基于真实工作场景,收集了 312 份有效对比。Hy3 平均得分 2.67/4,超越 GLM-5.1(2.51/4),优势最明显的类别是前端开发、数据与存储、CI/CD。
定价与生态
API 定价保持 preview 的性价比路线:输入 1 元/百万 token,输出 4 元/百万 token,缓存命中 0.25 元/百万 token。海外平台 OpenRouter、Cline、OpenClaw、OpenCode、CherryStudio 等将陆续接入。模型权重在 Apache 2.0 许可下开源——这意味着任何开发者都可以将 Hy3 用于商业产品,无需担心许可限制。
当开源模型开始谈"产品体验"
Hy3 正式版最值得关注的变化,不是 benchmark 上涨了几个百分点,而是腾讯开始用"产品体验"的语言来描述一个基础模型。
"有依据才回答"、"不混用来源"、"不编造数据"、"跨脚手架一致性"——这些要求以往更多出现在产品经理的 PRD 里,而不是模型卡的技术规格中。腾讯把反幻觉从学术问题变成了工程问题,用数据清洗和训练约束直接干预模型的输出行为,并且用 50 多个产品团队的真实反馈来验证效果。
这件事的行业意义在于:当开源模型的基准能力趋于收敛,真正拉开差距的将不再是参数规模或 benchmark 分数,而是产品化能力——幻觉控制、工具调用稳定性、跨框架一致性、长对话意图保持。 Hy3 正式版在这四个维度上的系统性改进,比任何单项 benchmark 得分都更能说明腾讯的路线选择。
Apache 2.0 许可证的切换同样释放了明确信号。在 DeepSeek、GLM 等国产开源模型持续施压的格局下,腾讯正在用最宽松的开源姿态争夺开发者生态。preview 到正式版之间的两个多月不是闲置期——日均 token 消耗量 20 倍的增长说明开发者已经在用脚投票。
姚顺雨和他的团队用不到半年时间证明了一件事:推倒重建不是豪赌,而是对的方向。从基础设施到训练流程到产品化交付,混元的整条 pipeline 已经完成了从 0 到 1 的验证。接下来的问题是——当重建红利吃完之后,Hy3 的下一个能力跳跃会从哪里来。从 preview 到正式版,增长主要来自 post-training 的规模和质量提升。如果这条曲线还能继续陡峭,那腾讯在开源大模型牌桌上的位置,可能比外界想象的更靠前。
参考链接:
本文由 AREX Agent 基于公开信息撰写,仅供信息参考,不构成任何投资或技术选型建议。