AREX Feed Article
Gemma 4 26B A4B 在 Mac 上提速 2 倍,Google 官方归功于社区排行榜
9 月 1 日晚,Google 官方 Gemma 账号 发推宣布:Gemma 4 26B A4B 在 Mac 上「刚刚提速 2 倍」(just got 2x faster)。推文把成绩归给开发者社区,说社区「一直在上发力,把 Apple Silicon 推向极限」,并附上排行榜链接和社区成员 。
官方口径是 2 倍,排行榜上的数字已经更高。推文发出前 26 分钟,榜单纪录刚被署名 i34-9 的解题者保持在 130.3%,约合 2.3 倍;整张榜单共 91 份有效提交,来自 32 位解题者。
官方账号把这次提速归给了社区
@googlegemma 的简介自称「Google Gemma 的官方主页」,称 Gemma 是 Google DeepMind 基于 Gemini 技术构建的开源轻量级模型。9 月 1 日 23:57(北京时间),账号发出这条两句话的推文:「在 Mac 上运行 Gemma 4 26B A4B 刚刚提速 2 倍!开发者社区一直在排行榜上发力,把 Apple Silicon 推向极限。」
随后它在自己的推文下补充:「完整细节见 @pratikg 的原帖」,并附上链接。官方账号把一项成绩的细节直接指向社区成员的原帖。
这条推文只能证明 Google 官方作出了「提速 2 倍」的宣布,不能独立证明成绩本身。「2 倍」出自官方口径,实现细节以 pratikg 的原帖为准;排行榜页面自报的 130.3% 与官方口径方向一致,同样来自主办方页面,本报道未做独立复测。
排行榜的分数是怎么算出来的
推文附的排行榜叫 The Gemma 4 MLX Challenge,托管在 yukon.org 的 mlxfast 页面,副标题写着「Live Apple Silicon optimization leaderboard」(实时 Apple Silicon 优化排行榜)。页面顶部的大字是:Gemma 4 26B A4B 现在比发布基线快 130.3%。
计分规则写得很具体:一次官方跑分把 8 个 prompt 放在同一批里跑,分别测 prefill(预填充)和 decode(解码)相对基线的增益,按 prefill^0.25 × decode^0.75 合成,解码占 3/4 权重。发布基线记为 0%,榜上分数都是相对这个基线的增益。本地提交的分数只是估算,官方分数要求在同一台 Apple Silicon Mac 上、经过散热冷却门槛(thermal cool gate)后,把基线与候选成对对比。
最新一笔提交来自 i34-9,工具是 Claude Opus,时间为 9 月 1 日 23:31(北京时间),对应解码 568.1 tokens/s、预填充 7,003 tokens/s。榜单按增益倒序排名,逐条标出每次提交给总分加了多少。
提交记录的「模型」一栏说明了这次提速的来源:解题者用来写优化代码的模型五花八门,Claude Opus、GPT-5.6、Qwen3、MiniMax M3、Gemini 3.7 Flash、Grok 4 都在列。pratikg 在原帖里把机制概括为「人类把 GPT-5.6、Claude、Qwen3、MiniMax 指向一张开放排行榜做 MLX 优化」。
不到三天,从 0.2% 到翻倍
榜单底部显示,最早可见的提交出现在 8 月 27 日,署名 davidtai,增益 +0.24%,总分只有 0.2%。此后分数被一点点推高,直到 8 月 30 日 9:07(北京时间),jacklightChen 的一笔提交 +1.94%,把总分推到 99.8%;24 分钟后,署名 0xpg 的提交 +0.33%,总分 100.1%,排行榜第一次跨过翻倍线。
pratikg 的帖子发布于 8 月 30 日 10:18(北京时间),讲的就是这一刻:「JUST IN:Gemma 4 26B A4B 在 Mac 上快了 2 倍。……jacklightChen 干了最难的活,把它做到 99.8%;我 24 分钟后出现,加了 0.33%。」
榜单记录与这段自述对得上:24 分钟后出现的那笔 +0.33% 提交,署名正是 0xpg。到 9 月 1 日,纪录从 100% 一路涨到 130.3%。
每项优化都回流到 darkbloomai 的服务器
排行榜挂在 yukon.org 上,主办方是 Yukon Research。社区成员的身份大多来自各自的 X 账号简介:pratikg(Pratik Gandhi)自称在 Eigen Labs「加速开放前沿」,同时发展 darkbloomai、Yukon Research 等项目;Soubhik Deb 的简介写着「Yukon Research 与 Eigen Labs 的科学发现领路人」。
优化成果的去向,里写明:「这里的每一项改进都会回流到 darkbloomai 做推理服务的机器上。全部公开。」署名 的用户转推呼应:「期待 mlx.fast 的改进被带回 darkbloomai,并扩散到更广的社区。Yukon Research 还会有更多。」
官宣之后,与排行榜主办方相关的社区成员接连回应。账号 转推说:「不敢相信 @googlegemma 转发了 mlx.fast!如果你在 Gemma 团队工作,想让它在各种本地机器上跑得更快,我们很想合作更多这样的挑战。私信开放。」Kydo 的简介自称在 Eigen Labs(Darkbloom、Yukon 等)工作,而 0xkydo 这个名字也出现在排行榜的提交记录里。同样自称在 Eigen Labs 的 直接在官方推文下回复:「下一版 Gemma,我们也想这么做。」 则转推称:「开放科学的典范。」
欢呼声里的一条散热质疑
(简介自称前华盛顿大学信息论教授)转推时给了自己的读数:「Gemma 在 MacBook 上快了 2.3 倍。感谢 Yukon,这个开放前沿研究网络:现在你可以去让它更快。」他说的 2.3 倍,对应的正是榜单纪录 130.3%。
:「部分增益来自人们把 Gemini 3.7 指向这张榜单。Google 的前沿模型,落在陌生人手里,用来加速 Google 自己的开源模型。其余来自 GPT-5.6、Claude、Qwen3 和 MiniMax。发布模型的团队会现身围观,这是新现象,只有开放权重才会发生。」
质疑来自一条具体的技术提醒。署名 的用户回复官方推文:「值得读一读排行榜自己的小字:分数是在『散热冷却门槛』之后测的,因为 Apple Silicon 在持续负载下会降频,同一个模型会因芯片当时的热度跑出不同数字。冷机测得的 130% 增益,不保证数小时真实 agent 负载下还有 130%。」排行榜页面确实写明官方分数要经过散热冷却门槛;冷机分数能否代表长时间负载下的表现,是这条回复留下的问题。