AREX Feed Article
Gemma 4 下载量突破 3 亿:开放模型的「闪电战」,Google 在赌什么?
Gemma 4 刚刚越过了 3 亿次下载。
7 月 23 日,Google Gemma 官方账号在 X 平台宣布了这一里程碑。推文写道:"Gemma 4 刚刚突破了 3 亿次下载。感谢与我们一同构建的开发者、研究人员和开源社区。你们的工作和反馈推动了项目的前进。"措辞简单,但时机巧妙——这条推文发布于 Alphabet 创纪录的 Q2 财报电话会之后不到 24 小时,同一个数字,Sundar Pichai 在电话会上已亲自点名。
3 个月,从 5000 万到 3 亿
Gemma 4 的增长曲线是一条几近垂直的线。
2026 年 4 月 2 日,Google DeepMind 正式发布 Gemma 4,提供 E2B、E4B、26B MoE 和 31B Dense 四个规格,全部采用 Apache 2.0 许可。发布时,Gemma 全系列的历史累计下载量为 4 亿次,社区贡献了超过 10 万个微调变体。
4 月 29 日的 Q1 财报电话会上,Pichai 透露 Gemma 4 "在短短几周内已被下载超过 5000 万次"。彼时这已经是一个不慢的速度——平均每天超过 180 万次。
到了 Q2(4 月到 6 月),数字加速膨胀。7 月 22 日的 Q2 财报电话会上,Pichai 给出了更新数字:"我们的 Gemma 开放模型系列已被下载超过 9 亿次。最新的 Gemma 4 模型自 4 月发布以来已被下载超过 3 亿次。"
粗算一下:从 5000 万到 3 亿,用时约 3 个月,净增 2.5 亿次下载。这意味着在 Q2 期间,Gemma 4 平均每天被下载超过 270 万次,日均增速比 Q1 又快了近 50%。
9 亿这个全系列累计数字同样值得注意。Gemma 系列从 2024 年初代发布到 Gemma 4 发布前夕积累到 4 亿,而 Gemma 4 一己之力在 3 个多月里拉动了全系列从 4 亿到 9 亿的跃迁——换句话说,Gemma 4 上线以来,Gemma 生态的新增下载量中超过一半是 Gemma 4 贡献的。
Pichai 为什么在财报电话会上点名 Gemma?
在 Q2 财报电话会上,Pichai 的核心叙事是 AI 正在渗透 Google 的每一条业务线,而他把 Gemma 4 的 300M 下载放在 Q2 成绩单的前半部分,与 Gemini 950M 月活、Cloud 营收增长 82%、AI Mode 突破 10 亿月活并列。
"我们的 Gemma 开放模型系列——小到可以在本地设备上运行——非常受欢迎。"Pichai 的原话传递了一个明确的信号:开放模型不是 Google AI 战略的边角料,而是被正式列入财报电话会脚本的战略级指标。
这一点分量很重。在 2024 年,业界普遍认为 Google 对开放模型的态度是"防御性"的——做 Gemma 是为了不让 Meta 的 Llama 独占开源心智。
但 2026 年 Q2 数据出来之后,叙事变了。当 Pichai 在同一个电话会上宣布 Gemini 4 正在训练、Gemini 3.6 Flash 已发布、同时把 Gemma 4 的 300M 下载作为独立亮点时,Google 的姿态已经转变为"双轨进攻":Gemini 守住云端和消费者市场的高端,Gemma 抢占开发者设备和本地推理的全部入口。
CFO Anat Ashkenazi 在电话会上给出了另一个关键数据:Alphabet 将 2026 全年资本支出指引从 $1800-1900 亿上调至 $1950-2050 亿,其中约 60% 投入服务器。
这些服务器在服务 Gemini 云端推理的同时,也为 Gemma 在 Hugging Face、Kaggle、Ollama 等平台的传播提供了基础设施支撑——开发者下载模型权重后在自己的硬件上跑微调和推理,但这个生态的起点仍寄托于 Google 提供的训练和分发能力。
一条命令,一个模型,一台电脑
这个数字在开发者社区引发了真实的共鸣。
Omar Sanseviero(Google DeepMind 员工,前 Hugging Face 首席 Llama 官)发推称:"Gemma 4 发布仅 3 个月就突破了 3 亿次下载。拥有能在消费级硬件、在你的设备上运行的高能力高效模型,解锁了如此多的使用场景,让 AI 更容易获取。看到这个生态成长如此迅速,非常令人兴奋。"
该推文获得了 262 次点赞——在一个以开发者为主要受众的账号上,这不是小数字。
在 Gemma 官方推文的回复区,开发者的反馈并非空洞祝贺。用户 @analogalok 分享了他将 Gemma 4 26B MoE 量化为 4-bit 后在 RTX 4060(8GB VRAM)上跑到 180K 上下文的详细基准——解码速度 22.8 tokens/秒,预填充 280 tokens/秒。另一位用户 @stevenmerrill 催促:"如果你们放出一个 100B 参数的 MoE,下载量会涨得更快。"
日本社区也有人注意到了这件事。用户 @h_a_t_a_r_a_k_e 写了一段长分析,指出 Gemma 4 的 3 亿下载量说明"开发者、研究人员和开源社区已经能够在自己的终端或本地部署环境中运行'实际可用'级别的模型"。
他的判断是:对中小企业和个人开发者来说,本地部署比云端的专用 GPU 更有吸引力。
还有一个容易被忽视的信号是 Hugging Face 对 Gemma 4 的"首发日"支持(Transformers、TRL、Transformers.js、Candle 全家桶)。这意味着模型权重发布当天,数万个依赖 Transformers 的项目就能直接切换。
这种分发效率对下载量的放大效应不可低估——Ollama 一条命令行安装、Kaggle 的直接下载按钮、Hugging Face 的一键部署,三个渠道同时发力,构成了 Gemma 4 的"下载加速引擎"。
开放模型正在变成一场分发战争
Gemma 4 的 300M 下载量不能孤立地看。把它放到开放模型的竞争格局里,才能看清全貌。
Meta 的 Llama 系列仍然是开放权重模型中下载量最高的。但 Meta 在 2026 年尚未更新 Llama 的主力版本(Llama 4 发布于 2025 年),Gemma 4 抓住了这个窗口。在 LM Arena 的开放模型排行榜上,Gemma 4 31B 当前排名第 3、26B MoE 排名第 6,两者都超越了参数规模 20 倍于己的对手。
阿里巴巴的 Qwen 系列是另一支重要力量。Qwen 3.6 在编码基准测试上表现出色,正在抢夺开发者心智。Mistral 的模型在欧洲和特定垂直场景中保持优势。
但 Gemma 4 一个独特的地方在于它的 Apache 2.0 许可——比 Llama 的自定义社区许可更宽松,比 Qwen 的部分模型许可限制更少。对需要将模型嵌入商业产品、或在监管严格的行业(政府、金融、医疗)中部署的企业来说,Apache 2.0 意味着零法律摩擦。
还有一个不常被讨论的维度:Gemini 的 API 生态反向哺育了 Gemma 的下载量。9 百万开发者每月通过 Google 的 AI API 构建应用——其中很多人先在 Gemini API 上做原型验证,然后用 Gemma 做本地部署。这个"云端验证、本地落地"的路径,是 Google 独有而 Meta 和 Mistral 无法复制的优势。
3 亿之后,双轨制的真正底牌
3 亿次下载的数字本身,不如它揭示的趋势重要。
这个趋势是:开放权重模型正在从业余爱好者的玩具变成企业的生产工具。当 Gemma 4 能在 RTX 4060 上跑到 180K 上下文、能在手机上做低延迟推理、能用一句 Ollama 命令部署时,"下载一次、本地跑一辈子"的经济账对中小企业来说比按月付 API 费更有吸引力。
Google 正在下一盘明棋:Gemini 吃掉所有愿意付钱买云的客户,Gemma 吃掉所有不愿意或者不能付钱的人——然后等后者长大了,自然流向 Google Cloud。Pichai 在 Q2 电话会上说"我们仍处于 AI 周期的早期阶段"(we are in very early innings),这句话的另一面是:下载量只是第一步,真正的变现还在后面。
对开发者而言,3 亿次下载意味着 Gemma 4 已经拥有了足够大的用户基数来支撑一个健康的微调生态——模型越多人用,社区贡献的量化版本、适配器、提示词模板就越多,反过来又吸引更多人下载。这个正向飞轮一旦转起来,后来者很难靠单次发布就追上。
唯一的问题是:Google 能否同时维持 Gemini 和 Gemma 两个品牌的投入节奏?Pichai 在电话会上承诺 GPT 级别的模型发布将按月推进,Gemini 4 正在训练中。如果 Google 能持续做到"每月一个新模型,开放和闭源同步更新",那它正在构建的就不是两条产品线,而是一个让竞争对手不得不同时在两条战线上应战的体系。
参考链接:
声明:本文基于公开信息整理,不构成投资建议。转载需注明出处。