AREX Feed Article
PrismML 发布 Ternary Bonsai 2 27B:Qwen3.8 27B 压缩至 5.9 GB,称保留 98.2% 基准性能
PrismML 于 9 月 17 日:一个基于 Qwen3.8 27B、把权重压缩成三值(ternary)表示的 27B 级模型,每个权重取 {−1, 0, +1} 三者之一,每 128 个权重共享一个 FP16 缩放系数(group-wise scaling)。公司称其打包后的存储开销为 1.76 有效比特/权重(bits per weight),语言模型体积 5.9 GB,约为全精度版本(53.8 GB)的九分之一;权重以 Apache 2.0 许可发布,支持 262K token(约 26.2 万词元)的上下文窗口,以及文本加图像的多模态输入。
PrismML 给出的性能口径是:在覆盖推理、数学、编程、指令遵循、工具调用与视觉理解的 20 项基准测试上,Ternary Bonsai 2 27B 平均得分 83.9,保留全精度 Qwen3.8 27B(85.4 分)的 98.2%;相比,保留率从 95% 提高到 98.2%。这些得分,以及本文引用的吞吐与能耗数字,都来自 PrismML 的发布文章、和 ,属于公司单方公布的口径。
图:PrismML 发布文章中的智能密度(每 GB)对比(Figure II),数据为公司单方公布。
三值权重怎么打包:存储账、旋转与两种 GGUF 格式
三值格式的存储账可以算得很清楚:每个权重只有三种取值,信息量是 log₂3 ≈ 1.585 比特;16 比特的缩放系数每 128 个权重摊销一次,约合 1.71 比特/权重。据 whitepaper,语言模型中另有 0.0976% 的参数(约 2,620 万个,集中在线性注意力层的状态路径与部分归一化层)保持在低比特表示之上,把整体平均推高到 1.72 比特/权重,对应约 5.80 GB 的理想值。实际发布的 GGUF 打包有两种:密集存放三值编码的 PTQ1_0(1.76 比特/权重、5.93 GB),以及把每个三值放进 2 比特槽位的 PQ2_0(2.16 比特/权重、7.25 GB);博客里给出的 5.9 GB 与 1.76 比特/权重,对应的就是 PTQ1_0 打包。
权重在存储前先经过一次旋转:每个矩阵按 1,024 的块大小乘以 Hadamard 旋转(含固定的 ±1 符号),再分配三值;旋转被折叠进已存储的权重,不额外占比特、也不增加权重搬运量,运行时对激活值施加对应的 Walsh–Hadamard 变换。Qwen3.8 27B 采用约 75% 线性注意力、25% 全注意力的混合结构;whitepaper 称,常见的低比特推理路径主要面向标准全注意力 Transformer,没有覆盖这种结构,PrismML 因此写了 CUDA 与 Apple Silicon(MLX)上的自定义内核,直接读取打包权重,避免在推理时把权重展开回 FP16。
整套模型 27.36B 参数:语言主干 24.35B,嵌入与 lm-head 2.54B,视觉塔约 0.47B。视觉塔单独打包,GGUF 版本附带约 0.63 GB 的 4 比特 mmproj(多模态投影)文件,只在图像输入时加载。MLX 版本保留全精度视觉塔,且其块格式每个组同时存 FP16 缩放与偏置,而三值权重并不需要偏置,最终包体为 8.49 GB,相当于 2.25 比特/权重。
分科平均:六类成绩与常规低比特对照
评测由 PrismML 自己完成:EvalScope 评测框架加 vLLM 推理后端,运行在 NVIDIA H100 上,全部采用思考模式与 xhigh 推理档;基准包括 MMLU-Redux、GPQA Diamond、AIME25/26、LiveCodeBench v6、τ²-Bench、BFCL v3、OCRBench v2 等。同尺寸的 Qwen3.6-27B 在相同的 20 项基准上平均 83.6 分,略低于 Bonsai 2 27B。按 whitepaper 的分科平均,数学 96.57(全精度 97.06)、编程 81.58(82.17)、指令遵循 82.66(反超全精度的 81.25)、知识与推理 83.95(86.66)、工具调用与代理 77.57(79.74)、视觉 78.59(81.64)。
作为对照,常规低比特方案的 Qwen3.8-27B IQ2_XXS 打包体积 7.3 GB,比 Bonsai 大 1.23 倍,20 项平均 75.2 分;在推理密集的任务上差距更明显:AIME26 得 78.6 分(Bonsai 95.83),LiveCodeBench v6 得 70.05 分(Bonsai 90.07)。
143 tokens/秒与 0.714 mWh/token 怎么测出来的
博客称该模型最高可达 143 tokens/秒(GeForce RTX 5090);whitepaper 的表格中,RTX 5090 上 PQ2_0 打包为 142.5 tokens/秒、PTQ1_0 为 134.4 tokens/秒,M5 Max 笔记本为 46.8 tokens/秒,M5 Pro 为 27.7 tokens/秒,M4 Pro 为 18.0 tokens/秒(whitepaper 注明 M4 Pro 一项来自旋转前的早期构建)。能耗方面,RTX 4090 上为 0.714 mWh/token(每生成一个 token 约 0.714 毫瓦时);博客还称,这比一个全精度运行的 8B 模型节能 40%。
测量条件写在 whitepaper 附录:token 生成(tg128)与提示处理(pp512)分开测量,batch size(批大小)固定为 1,不含视觉塔,预热后重复三次取均值,测量日期为 2026 年 9 月 16 日。NVIDIA 端取板卡功耗,包含 HBM/GDDR;Apple 端 powermetrics 不覆盖 DRAM,因此公司没有给出 Apple 平台的每 token 能耗,只报告了 M5 Pro 上 27.0 W(GPU)与 32.8 W(CPU+GPU)的绝对功耗。
两种打包也不存在统一的快慢:PTQ1_0 每步搬运的权重数据少 18%,但解包代价更高,在 Ada 架构与 L4 上更快,在 Ampere、Hopper、Blackwell 与 Apple 芯片上则慢于 PQ2_0。whitepaper 的解释是,显存受限设备看重少搬字节,而大型加速器上指令吞吐与调度开销成为瓶颈。
在边缘设备上,体积差直接体现在能不能装下:16 GB 内存的笔记本装不下 53.8 GB 的全精度版本和 17.6 GB 的 Q4_K_XL,两种三值打包都能装下;M5 Pro 上约 201 GB/s 的权重搬运量说明解码阶段由内存带宽主导。
权重已在 Hugging Face 上线:GGUF 与 MLX
权重在发布当天上线 Hugging Face:收录了 GGUF 与 MLX 两种版本,GGUF 面向 llama.cpp(CUDA、Metal、CPU),MLX 面向 Apple Silicon;collection 里另有 gguf-dev 仓库和一个可在浏览器里通过 WebGPU 运行的演示空间。据 ,PrismML 为低比特内核维护了 llama.cpp、MLX 与 mlx-swift 三个 fork。新闻稿写明,开发者与研究者自 2026 年 9 月 17 日起可在 Apache 2.0 许可下免费下载这些权重;博客称模型可经 CUDA 运行在 NVIDIA GPU 上,也可经 MLX 运行在 Mac、iPhone、iPad 上。
文本推理只需要语言模型本身,图像输入再加载视觉塔包即可。PrismML 列出的适用场景包括本地助手、多模态代理、私有文档分析、在计算机上执行操作的 computer-use 流程与长时间运行的代理任务,以及把敏感或高频任务放在本地、必要时升级到云端的混合编排。
公司高管的表态与“智能密度”
新闻稿里有两处署名表态。PrismML 创始人兼 CEO Babak Hassibi 说:“Bonsai 27B 证明了强大的模型不必被限制在云基础设施里。借助 Bonsai 2 27B,我们在缩小质量差距的同时保留同样的部署优势:显著更小的体积、强劲的本地性能,以及支撑代理式编程、多模态理解、长程任务执行等更高要求工作流的能力。”PrismML 顾问、加州大学伯克利分校教授 Ion Stoica 说:“AI 部署在历史上一直迫使人们在模型质量与运行它所需的资源之间做选择。Bonsai 2 27B 引人注目的是,在体积大幅缩减的情况下能力损失如此之小。如果这一差距继续收窄,将从根本上扩大高性能模型的部署范围。”
新闻稿还称,PrismML 出自一支 Caltech 研究者团队,创立时获得 Khosla Ventures、Cerberus 和 Google 的支持,并持续获得三星的支持。在 whitepaper 里,PrismML 用来比较这类模型的指标是“智能密度”:按 −log₂(1 − 平均分/100) 算出“智能”,再除以模型体积(GB)。按这个口径,Ternary Bonsai 2 27B 为 0.444/GB,Qwen3.8-27B FP16 为 0.051/GB,IQ2_XXS 为 0.276/GB。
长程代理的落差与路线图上的未完成项
需要多步执行的代理任务,保留率低于其他几类评测。whitepaper 首次报告了 Terminal-Bench 2.1 与 SWE-bench Verified 成绩:Ternary Bonsai 2 27B 分别为 52.8 分与 60.8 分,全精度 Qwen3.8 27B 为 69.7 分与 80.6 分,公司自己描述为“保留约四分之三”。其他代理与长上下文指标则更接近全精度:τ²-Bench 80.2 分(上一代 73.6 分),BFCL v3 74.9 分,AA-LCR 77.0 分。
PrismML 对这些数字的解释是:这个体积上的模型通常做不出有意义的进展,常规低比特量化更会让代理能力整体崩塌,而 Bonsai 2 27B 仍能维持持续的工具调用与端到端软件工程流程。whitepaper 同时列出了 xhigh 与 medium 两档推理力度的完整分项得分。
whitepaper 的“限制与路线图”章节列出三项未完成工作:让 PTQ1_0 在所有场景下都达到 PQ2_0 的速度,是“活跃的工程目标”;batch size 1 的解码中,激活侧的旋转变换仍是较大的非矩阵乘开销之一,公司强调这纯属实现成本、不影响输出质量;把 KV cache(键值缓存)压缩到 4 比特以下已有“早期结果”,据 whitepaper,这可以支持在固定显存下使用更长的上下文。