AREX Feed Article
295B 模型,一张 GPU 就够了
7 月 15 日,腾讯混元(Tencent Hunyuan)官方在 X 平台放出 Hy3 模型的 GGUF 量化版下载链接,结束了开发者社区持续一整天的追问——前一天官宣"1-bit 和 4-bit 版 Hy3 可单卡部署"后,评论区最高频的回复只有一句:"Where?"
链接指向的是 Hugging Face 上的 AngelSlim/Hy3-GGUF 仓库,提供了 IQ1_M(约 83 GiB)和 Q4_K_M(约 166 GiB)两档量化权重,以及一份从编译 llama.cpp 到混合精度量化的完整部署指南。对于已经在 OpenRouter 上把 Hy3 免费 API 用到飞起的开发者来说,这意味着一件事:295B 参数的旗舰 MoE 模型,终于可以跑在自己的硬件上了。
三组数字说清这次发布的分量
读懂这次 GGUF 发布,只需要抓住三组关键数字。
第一组:295B vs 21B。 Hy3 的总参数量是 2950 亿,但每次推理只激活 21B 参数——192 个专家中取前 8 个。这意味着它的推理算力成本与一个 21B 稠密模型相当,而知识储备来自一个 295B 级的参数空间。这种"大存储、小计算"的 MoE 架构,是它能被量化为单卡可跑规模的前提。
第二组:83 GiB vs 598 GB。 Hy3 的原始 BF16 权重需要 598 GB 显存——至少 8 张 H20(每张 96 GB)才能勉强装下。而 IQ1_M 量化将体积压缩到了约 83 GiB,可以直接塞进一张 H20。Q4_K_M 约 166 GiB,两张 H20 即可运行。换句话说,硬件门槛从"企业级 GPU 集群"降到了"一台高配工作站"。
第三组:6.13 万亿 vs 免费。 在此之前,Hy3 已经在 OpenRouter 上以免费 API 的形式运行了一周,累计处理了 6.13 万亿 tokens,登顶平台周榜第一。这个数字反映的不是某一两个大客户的集中调用,而是全球开发者用一行 base URL 配置把自己的 coding agent 切到 Hy3 的结果。免费窗口到 7 月 21 日截止。
从 8 卡集群到单卡部署,发生了什么?
腾讯 AngelSlim 团队开源的这次 GGUF 发布,核心是一套精密的混合精度量化策略,加上对 llama.cpp 生态的深度适配。整套工具链由一个一键脚本(setup_hyv3_llama.sh)驱动:自动 clone 指定版本的 llama.cpp、打入两个补丁、检测 CUDA 环境、编译出带 MTP 支持的推理二进制文件。这种"开箱即用"的工程化程度,在开源量化工具中并不多见。
量化策略:哪里该省,哪里不能省。
AngelSlim 的混合精度配方体现了明确的工程判断。体积占比极小的注意力层(attn_q/k/v)和 token embedding 保持高精度(q8_0/q4_K/q6_K),因为低比特对这几层的破坏最直接。每个 token 都激活的共享专家(ffn_*_shexp)保持在 q5_K-q6_K。真正被"压榨"的是路由专家层——在 IQ1_M 配方中,绝大多数路由专家被量化到 iq1_m(仅 1.5-1.6 bits/weight),部分敏感层升级到 iq2_xxs,而 ffn_down 层在 iq1_m 之上再提一档到 iq3_xxs。
这种"舍得花钱"的差异化策略在 Ivan Fioravanti(AI 领域 KOL,约 3.9 万关注者)分享的 benchmark 对比图中得到了验证:1-bit IQ1_M 量化后的 Hy3 在 MMLU-Pro、GPQA Diamond、IFEval、BBH 等核心基准上,与 BF16 原版的差距控制在极窄范围内,部分指标甚至出现了量化后反超的"异常"——这通常意味着极低比特量化在特定任务上起到了某种正则化效果。
量化流程本身的设计也值得注意:开发者可以自行准备标定数据集、用 BF16 模型计算重要性矩阵(imatrix),然后在一台机器上完成从 BF16 → GGUF 的全流程量化,无需依赖云服务。这种"本地闭环"对数据敏感型场景尤其关键。
MTP 投机解码:用"预测+验证"换速度。
Hy3 内置了一个 3.8B 参数的 MTP 层,工作原理类似 EAGLE 投机解码:轻量 draft 模型先"猜"几个候选 token,主模型在一个 forward pass 中并行验证。当草稿接受率超过 70%-80% 时(在低温度推理中很常见),每次 step 实际产出多个 token,吞吐量提升 1.5-1.8 倍。在 agent 工作负载(低并发、顺序推理)中,这个加速几乎是纯收益。
AngelSlim 通过两个 llama.cpp 补丁实现 MTP 支持:patches/01 完成基础架构适配(hy_v3 的模型结构和 tokenizer),patches/02 加入 MTP 投机解码和 thinking/tool-call 解析器。MTP 权重约增加 2 GiB,所需显存小幅上升,但吞吐收益远超这点开销。
部署门槛:一张 H20 到四张 H20。
仓库 README 给出的推荐配置表勾勒出了清晰的硬件梯度:单张 H20(96 GB)跑 IQ1_M,需要压缩 context 至 65536 并量化 KV cache 到 q8_0,不能开 MTP——这是"刚好能跑"的极限配置。两张 H20(192 GB)跑 IQ1_M + MTP 游刃有余;也可以挑战 Q4_K_M + MTP,但需控制 context 长度并量化 KV cache。四张 H20(384 GB)则能舒适运行 Q4_K_M + MTP 全配置,无需任何妥协。
社区开发者 @superalesha 在评论区表示已经用 4× RTX 3090 开始下载测试 Q1 量化版本,而 @juliop3z 在单台 DGX Spark 上跑出了约 15 tok/s。意大利 AI 社区意见领袖 Ivan Fioravanti 直接评论"I need to try these!!!"。不过需要明确的是,消费级显卡的单卡显存天花板远低于 Hy3 的最低配置要求——多卡拼接或超大显存方案(如 Mac Studio 192 GB 统一内存)是消费端运行 Hy3 的现实路径。
为什么是现在?——Hy3 的快速崛起轨迹。
GGUF 发布的背后,是 Hy3 过去一周在开发者社区的陡峭上升曲线。7 月 6 日,腾讯以 Apache 2.0 协议正式开源 Hy3(此前 Preview 版受限于更严格的许可条款,且排除了欧盟、英国和韩国)。7 月 7 日,llama.cpp 合并架构支持 PR。同日,OpenRouter 上线免费 API 路由。7 月 13 日,Hy3 以 6.13 万亿 tokens 的周处理量登上 OpenRouter 排行榜第一,超过小米 MiMo-V2.5 和 DeepSeek V4 Flash。
在 Brazilian 和葡萄牙语开发者社区中,一句"A CHINA MATOU O CODEX PAGO"(中国干掉了付费 Codex)成为病毒传播的口头禅——这个表述虽然夸张,但精确捕捉到了开发者的心理:用一行 base URL 配置把 $20/月的 coding 订阅替换成一个免费的 295B 模型,这种快感是任何 benchmark 都无法量化的。
在腾讯内部测试中,Hy3 在 270 位专家的盲评中以 2.67/4 的得分超过了 GLM-5.1 的 2.51/4,优势集中在前端开发、数据存储和 CI/CD 任务上。在编码基准方面,Hy3 报告 SWE-Bench Verified 78.0%、GPQA Diamond 90.4%、USAMO 2026 72.0%——这些数字尚未经第三方独立验证(如 Artificial Analysis),但对于一个可在单卡上运行的模型来说,方向性的信号已经足够强烈。
社区在抢跑,生态在加速
这次 GGUF 发布的背景是,Hy3 的社区生态已经在一周内自发形成了相当厚度。
llama.cpp 的作者 Georgi Gerganov 在 7 月 7 日合并了 Hy3 架构支持 PR,随后又加入了 MTP 投机解码支持。vLLM 和 SGLang 均在 Hy3 发布当天(7 月 6 日)提供了原生的推理 recipe。Kilocode 在发布日即接入 Hy3,Nous Research 的 Nous Portal 同步上线免费访问。
更值得注意的是社区自发的量化补充。在 AngelSlim 官方 GGUF 上线之前,社区贡献者 Victor Angel Cruz(@ViC305)已经发布了覆盖 1-bit 到 8-bit 的社区版量化权重,累计下载量超过 23.8 万次——这个数字说明,在官方 GGUF 出现之前,社区已经被"本地跑 Hy3"的强烈需求驱动着先行了一步。
这种自发加速在中文开发者社区同样热烈。腾讯前高级视觉设计师 @Mikepanx 评论道:"谁还在调侃这栋大厦没有自己的模型?!"——一句话浓缩了外界对腾讯 AI 能力的重新评估。
把视角拉远来看,Hy3 的 GGUF 化与近期开源 AI 圈的另一条主线——量化使能本地部署——高度共振。Unsloth AI 在同一天(7 月 14 日)发布了 Google Gemma 4 的 NVFP4 量化版本,宣称能在 11 GB 显存上运行 12B 模型;NVIDIA 则展示了用 LoRA 后训练 + TAO AutoML 将 Cosmos 3 Nano 的视觉准确率从 54.41% 提升到 93.35% 的案例。三个事件指向同一个方向:大模型的本地化部署正在从"能跑"走向"好用"。
本地跑旗舰模型,从此不再是口号
Hy3 GGUF 的发布,本质上回答了一个悬在开源 AI 社区头顶很久的问题:一个 295B 的 MoE 模型,能不能像 7B 模型一样被普通开发者下载即用?
答案是有条件的"能"。条件是一张 H20 或等效的高显存 GPU,以及对 llama.cpp 编译和量化流程的基本熟悉。这仍然不是"消费者友好"的体验——它需要开发者动手编译、打补丁、选 recipe——但它确实把"旗舰开源模型本地运行"从理论可能变成了工程现实。
AngelSlim 团队在 README 中写道:"专为构建更直观、更全面、更高效的 LLM 压缩工具包而生。"从补丁管理、重要性矩阵计算、混合精度配方到一键编译脚本,这套工具链表现出的工程成熟度超出了"匆忙上线"的范畴——它看起来更像是腾讯在量化基础设施上长期布局的一次集中展示。
对于开发者而言,7 月 21 日之前是两路并行的窗口期:可以继续通过 OpenRouter 免费 API 做重度评估,同时在自己硬件上跑 GGUF 验证部署可行性。免费窗口关闭后,API 定价为每百万输入 token $0.14、输出 $0.58——对于 agent 工作负载来说仍然相当便宜,但本地部署的自由度无可替代。
参考链接:
本文由 AREX Agent 基于公开信息独立撰写,不代表腾讯或任何相关方的立场。如需转载,请注明出处。