AREX Feed Article
Extropic 发布面向 Z1 概率芯片的首个类 Transformer 模型 Z1T,自称解码能效约为 H100 的 140 倍
美西时间 9 月 4 日(北京时间 9 月 5 日凌晨),概率芯片公司 Extropic 发布 Z1T——为其上个月公布的 Z1 概率芯片打造的首个类 Transformer 模型系列。 同一时间,官方 X 账号发帖称,Z1T 是「为 Z1 这类稀疏概率硬件打造的首个类 Transformer 模型家族」,能效最高可达 GPU 的 140 倍,并「揭示了一条稀疏 Transformer 的新缩放定律」。
具体口径是:按 Extropic 的估算,Z1T 解码通路每生成一个 token(词元)耗能 294.52 nJ,同样的下一步 token 计算在 NVIDIA H100 上按 10% 的模型算力利用率(MFU)估算耗能 40.9 µJ,能效约为 H100 的 139 倍;利用率越高,差距越小。官方推文里的「最高 140 倍」对应表格中 H100 低利用率这一档(139 倍四舍五入),博客正文则把整体概括为「约两个数量级」的能效提升。
与 Z1T 一起发布的,还有训练配方和其中一次较大规模运行的权重:配方以 Apache-2.0 许可开源在 ,权重以 Z1T-0 为名挂在 ,这是 Extropic 开源的首个模型。以上性能与能效声明均系公司估算口径,未经独立验证。
稀疏图上的 Transformer:GCA、DyT 与 FPGA 分工
Z1 是 Extropic 在 8 月初公布的「概率亚阈值 CMOS」芯片:单颗芯片上有 269,568 个 pbit(概率比特,二进制随机 CMOS 电路),排成一张每个节点 16 条可调耦合的固定图,全片共 2,135,904 条硬连线耦合边,芯片以 50 MHz 的内部时钟对可编程 Ising 模型做 Gibbs 采样,更新在存储内完成。
稀疏连接是这颗芯片省电的关键,也是无法绕过的硬件约束:GPU 靠缓存层次实现核心间的全互联、擅长稠密矩阵乘法,而 Z1 只能高效执行「恰好落在连线上」的稀疏运算。
因此 Z1T 没有沿用为 GPU 稠密矩阵乘法优化的标准 Transformer 算子,博客称这是主流 Transformer 的「第一次算法变异」(first step of algorithmic mutation),改动集中在三处:用可融合进采样层的 Dynamic Tanh(DyT)替换 RMSNorm;用门控卷积注意力(GCA)替换 softmax 注意力——Q、K、V 先经 4-稀疏投影算出,再用两个 conv1d 分别对 exp(K)∘V 和 exp(K) 做滑动窗口累加,得到归一化输出;前馈网络则变成在片上逐单元求期望的 tanh-linear 层。权重采用 4 比特的 dy4p/pInt4 编码(一个数由 4 个 pbit 按 1/4 至 1/32 的位权表示),输出经典数值向量时对 pbit 流做统计平均而非单次采样,采样次数越多等效精度越高,运行时可调。
执行上,Z1T 走的是异构流水:首代系统在同一块板上预装 FPGA,Z1 只跑 DyT 和稀疏投影这类采样层,FPGA 承担 embedding(嵌入)、残差、池化、位置编码与词表 logits(对数几率)读出。博客中的能效和延迟估算都按「Z1 加 FPGA 协处理器」这套组合给出,并注明协处理器换成 GPU 或其他 XPU 原则上可行,留给未来工作。
H100 利用率越高,能效优势越小
博客把对比拆成两列。整条推理通路的能效比(Z1 采样加 FPGA 运算,不含两者间的数据搬运)随 H100 利用率变化:10%、50%、100% MFU 下分别约为 139 倍、28 倍、14 倍。第二列只看 Z1 上运行的层,同三档下分别约为 4,680 倍、935 倍、468 倍。294.52 nJ 里,Z1 采样只占 8.74 nJ,其余 285.78 nJ 花在 FPGA 上,占比超过 95%。博客据此展望,若把更多运算搬上这类亚阈值 CMOS 基板、去掉 FPGA 瓶颈,理论上可能达到约 1,000 倍于 GPU 的能效。
延迟一侧:假设单条串行流、不做高级流水,Z1T 每 token 约 58.8 µs,折合约 17,000 tokens/s;同一模型在 H100 上 eager PyTorch 约 702 µs(约 1,425 tokens/s),torch.compile 后约 102 µs(约 9,764 tokens/s)。H100 基线是 2026 年 8 月 12 日实测的稠密等价模型(D=512、L=4、fp16、约 1,155 万参数)。公司自己也提醒:这个规模在 H100 上只能跑到 0.006% 的 MFU,kernel 启动耗时占比很高,GPU 上做 batch 会高效得多,所以 Z1 加 FPGA 的组合建议用于 decode(解码),prefill(预填充)现阶段仍交给 GPU。
口径限制同样写在博客里:Z1 的功耗按芯片「理论功耗」估算,用 X0 实验中同类 pbit 的数据锚定;能效比不含最后的稠密词表读出(若把 FPGA 上的词表读出计入,每 token 能耗会升至约 136.4 µJ);不含 Z1 与 FPGA 之间的数据搬运;所需 Z1 芯片数量也没有建模。
追平 GPT-2-small,要多花约一个数量级的 FLOPs
缩放实验分两步。第一步,Z1T 系列在 OpenWebText 上用 GPT-2 的 BPE tokenizer(分词器)训练,扫描模型规模、训练算力和稀疏度,得到一条与经典 Transformer 平行的经验缩放曲线,但多了一个可扫的变量:连接度(connectivity)。外推结果显示,稀疏的 Z1T 要达到与 GPT-2 相同的验证损失,需要多花约一个数量级的训练 FLOPs:以 GPT-2-small(8,500 万参数,同口径不含词表矩阵)为基准,约需 9.5×10¹⁹ FLOPs。
多花的训练 FLOPs,要靠 Z1 上低得多的算子能耗来抵消:博客称,Z1 上执行的算子比 GPU 同类算子节能约三个数量级。
第二步是更一般的稀疏性研究,在一个标准 GPT-2 式 decoder(解码器)上加唯一旋钮 c,它固定每个输出节点的入边数,同时作用于投影矩阵和窗口注意力;扫 c ∈ {4, 16, 32, 64, 128} 与一个稠密基线,训练预算从 3×10¹⁴ 到 10¹⁸ FLOPs。关键在于这是固定度数而非固定百分比稀疏:宽度增加时,百分比稀疏度会趋近 100%,实验中跨度达 5%~99.8%。isoFLOP 分析显示,相同参数量下稠密 FLOP 更有效率;但「FLOP 在不同基板上价格不同」——Z1 是存内计算,稀疏乘加的能耗远低于 GPU,稀疏模型因此仍可能以一小部分功耗达到同等性能。公司称这套以连接度为新增变量的缩放定律,是用来决定下一代芯片该给每个节点配多少条连线的设计依据。
这两步实验的产出都开源了:GitHub 仓库 extropic-ai/sparse-transformers(Apache-2.0,JAX 代码,含 research/st 稀疏因果语言模型与 research/z1t 两个项目)承载训练配方,Hugging Face 上的 Extropic-AI/Z1T-0 模型卡写着「Open weight for the first Z1T-0」,对应博客所称「较大规模训练运行」之一的权重。博客作者在文中写道,他们相信开源推动 AI 进步的力量,「终于能开源我们的第一个模型」让他们很高兴。
从 8 月的芯片公告到 9 月的模型发布
Z1T 博文由 Guillaume Verdon、Alexander Neagoe、Owen Lockwood、Seth Morton 署名,落款 Extropic San Francisco。公司在文首把目标表述为「为智能打造终极物理基板」,长期论点是热力学硬件与算法共同演化,最终会催生随机热力学与生成式 AI 交叉处的新原生模型。
眼下更迫切的问题是 Transformer 推理的能耗:这类架构的训练与推理占现代数字加速器工作负载的极大份额,而 GPU/XPU 存量巨大,所以切入点放在异构协同上:把热力学加速器与数字矩阵乘法加速器(GPU、XPU 等)拼进同一条推理流水线,以改善机架和数据中心级的每瓦性能。
时间线上,Z1 芯片一个多月前才亮相:Extropic 于 8 月 3 日在官网发布《》,次日 Z1 芯片与硬件系统、Torx 软件框架、Thermalizers 编译器及模拟器 API;该文称 Z1 已流片,卡片、条与集群形式的系统计划在 2027 年提供早期访问。Z1T 博客同时强调,这是一项「稀疏神经网络与硬件协同设计的初步研究」,Z1 的设计早于 Z1T 的构想,这些结果将反馈到未来的芯片设计。
发布首日的两种技术回应
官方推文在发布后约十小时获得约 1,800 个赞、超过 21 万次浏览(检索时快照),技术圈的第一轮回应已经出现分歧。
昵称 zach、简介自称「silicon socialite」的 X 用户 直接提出质疑:「这基本上就是一个稀疏量化 Transformer,没有概率采样,p-bit 的噪声没有带来任何价值。」Extropic 在文中写明,输出的是对热力学计算机统计量的平均而非单次采样结果,两种说法对「噪声与平均」角色的判断并不相同。
自称正在构建 exolabs、曾在牛津大学的 则把注意力放在异构拆分上:「TSU(热力学采样单元)在这类稀疏神经计算上极其省电……把这些全放到 TSU、其余放到 XPU 或 FPGA,能效高得多,也更快。」
两边的判断目前都只能各执一词:训练配方(JAX 代码)和 Z1T-0 权重已经公开,损失曲线与缩放实验可以照着重跑;这套能效数字则建立在理论功耗估算上,何时能用实测数据检验,取决于 Z1 硬件的就绪节奏。按 8 月公告的时间表,卡片、条与集群的早期访问安排在 2027 年。