AREX Feed Article
腾讯官方仓库披露 Hy4-preview 笔记本级实测:4090+4×A4000 联合推理 1.02 tokens/s
9 月 1 日,腾讯在官方 GitHub 仓库 的发布说明中,首次披露 Hy4-preview 超低位量化版 MIX-STQ1_0 的笔记本级部署实测:一台 4090 笔记本(32GB 内存、16GB 显存)加一台 4×A4000 服务器(32GB 内存、每卡 16GB 显存)联合推理,速度为 1.02 tokens/s(每秒约 1 个 token)。腾讯称该版本把 1.5TB 权重压缩至 214 GiB,在 SWE-bench Pro 上性能仅下降 0.7%,实测基于 Prima.cpp 完成。
此前的口径是 8×H20 服务器吞吐;独立测试者对超低位构建的复测则发现其在否定性指令上明显失分(见此前报道)。9 月 1 日这则发布说明没有提及复测,只给出部署实测与 SWE-bench Pro 一项性能数据,同时确认了 AngelSlim 仓库作为官方一手发布渠道的身份。
AngelSlim:混元 AI Infra 团队的官方发布渠道
Tencent/AngelSlim 是腾讯开源的模型压缩工具包(1.6k star、240 次提交),README 注明由腾讯混元 AI Infra 团队开发。9 月 1 日,其「Latest News」栏出现新条目,日期戳 [26/09/01],宣布 hy4 preview MIX-STQ1_0 版本发布;条目末尾附了 与部署指南两个链接。
同一则消息在里的表述是:「我们已发布 hy4 preview MIX-STQ1_0 版本!模型从 1.5TB 压缩至 214 GiB,在 SWE-bench Pro 上的性能仅下降了 0.7%。」但中文条目的日期戳写的是 [26/07/29],与英文版 [26/09/01] 不一致,恰好撞上上一条 AngelSpec 新闻的日期,像是复制粘贴时留下的错位。
仓库历史显示这条产品线的来路:1 月 13 日发布 Sherry 1.25-bit 三值量化算法,5 月 8 日发布 STQ1_0 内核并向 llama.cpp 提交 PR #22836。
61 层留给 A4000,17 层留给 4090:模型怎么拆到两台机器
发布说明附的给出了两机架构:四张 A4000 的机器跑 rank-0 prima-server,统一对外提供 OpenAI 兼容 API;4090 笔记本跑 rank-1 worker。示例部署计划把 15、15、15、16 共 61 层分给四张 A4000,17 层留给 4090。
两台机器各有要求:x86-64 Linux;A4000 机基于 Ubuntu 24.04 与 CUDA 12,4090 机基于 Ubuntu 22.04 与 CUDA 13;每台约 31GB 系统内存;213.66 GiB 的 STQ1_0 模型文件两台都要存放。运行时不是开箱即用:要先从 Hugging Face 仓库下载两个预编译 runtime(运行时)包(a4000 rank-0 与 4090 rank-1,包内只有编译好的二进制与库文件),再在本地生成各自机器的 receipt(模型凭证)与共享 plan(层分配计划),并打通两台机器之间的网络端口。指南注明:「当前公开版开源版本不含这套 MoE(混合专家)支持」,属高级预览。
性能口径同样有保留:预热后、单请求并发下测得稳定解码约 1.02 秒/token(发布说明写的是 1.02 tokens/s,两种单位写法略有出入,量级一致);提示缓存主要改善首 token 延迟,不会让后续解码更快。
三值权重与逐层位宽:压缩是怎么实现的
列出三个 GGUF 构建(GGUF 是 llama.cpp 使用的模型存储格式):标准 4-bit 的 Q4_K_M(435.20 GiB、4.86bpw,bits per weight,每权重比特数)、UD-IQ1_M(219.83 GiB、2.44bpw)和本次发布的 STQ1_0(213.66 GiB、2.38bpw),对应 770B 参数的 Hy4-preview。STQ1_0 的格式来自 llama.cpp PR #22836:权重为三值 {-d, 0, +d},每 4 个权重位(lane)强制 1 个置零(3:4 稀疏),每 4 个权重用 4-bit code 加 1-bit 选表位索引 32 项码本(codebook),256 个权重共用一个 fp16 scale(缩放系数),合计每 256 权重 42 字节,即 1.3125 bpw。
MIX-STQ1_0 的逐层分配是这次新披露的细节:路由专家的 gate/up 投影在 29 层用 1.3125 bpw(STQ1_0),其余 48 层用 2.0625 bpw(IQ2_XXS);ffn_down_exps 用 IQ3_XXS、最后 3 层用 IQ4_XS,因为该张量直接写回残差流,误差不会被后续 gate(门控)衰减;注意力与 MLA 部分用 Q5_K/Q8_0,router、norms、output 保留 F32。模型卡还披露了编码器改动:用加权最小二乘求 scale,实测加权 SSD(误差平方和)降 89.7%;再按 imatrix(重要性矩阵)感知的增量代价放置零位,再降 4.1%。
9 月 1 日的报道把方案概括为:使用 Sherry 稀疏三值量化——最激进设置平均 1.25 bit——配合 MIX-STQ1_0 按校准数据逐层分配位宽;长上下文理解与检索接近原版,数学能力小幅回落;编码辅助、工具调用、长文档处理与通用问答仍然保留。运行要求上,模型卡提醒 chat 必须加 --jinja,且这些构建在原生 llama.cpp 上跑不起来,hyv4 架构尚未进入上游,需要应用补丁。
作为参照,模型卡给出的 8×H20 实测为 prefill(预填充)204.56 ± 1.42 t/s、decode(解码)20.47 ± 0.02 t/s(中文表格同栏写 19.52 ± 0.01)。笔记本方案的 1.02 tokens/s 约为其解码速度的二十分之一。
指南自己写的是「参考结果而非保证」
以约 1 秒/token 计,一段百 token 级的回答要等一两分钟,交互式对话每一步都要等近一秒。指南示例按 8K 上下文配置,服务端不限制生成长度,客户端可自行设 max_tokens(单次生成上限)。
官方这次的质量口径只有 SWE-bench Pro 一项,发布说明没有给出指令遵循类指标;此前独立复测指出的否定性指令失分在笔记本方案上是否同样存在,官方数据没有覆盖。
指南把这项成绩明确定义为「参考结果而非保证」,并列出提示长度、模型路由、存储速度、可用内存与机器负载等影响因素。这套数字能否在别家机器上复现,要等指南的每一步被照着走完才知道。