AREX Feed Article
三个 Flash 一起发,Pro 还是没来——Google 的 AI 两条战线正走向分化
AI 行业的默认剧本是:先发 Pro 定调,再用 Flash 收割。Google 却把剧本反了过来。
5 月的 Google I/O 上,CEO Sundar Pichai 承诺 Gemini 3.5 Pro 将在 6 月上线。7 月 21 日,Google 一口气放出三个新模型——Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber——但 Pro 依然不见踪影。Google 在官方博客中只写了一句:"Gemini 3.5 Pro is currently testing with partners and we plan to make it broadly available as soon as it's ready."
与此同时,Gemini 4 的预训练已经启动,被描述为 Google "迄今为止最雄心勃勃的一次训练"。这一快一慢之间,Google 在 AI 模型竞赛中的两条战线正在清晰分化。
三个模型,一条主线:效率
新发布的三款模型全部指向同一个关键词——效率。
Gemini 3.6 Flash 是本次发布的绝对主角。它直接基于 3.5 Flash 的开发者反馈迭代而来,核心卖点是"更聪明,也更省 token"。根据 Artificial Analysis 指数,3.6 Flash 的输出 token 消耗比 3.5 Flash 减少 17%;在 Datacurve 的 DeepSWE 基准测试中,减少幅度高达 65%。与此同时,价格还更便宜——输入 $1.50/百万 token,输出 $7.50/百万 token。
这种"既降本又增效"的组合打法在开发者群体中显然奏效。Figma 的工程 VP Kris Rasmussen 在博客中表示,3.6 Flash 在设计到代码的转换任务中"准确率显著提升,同时 token 消耗大幅下降"。Harvey 的 CTO Gabe Pereyra 则强调模型在多模态文档解析能力上的进步,称其"在处理复杂图表和财务报表时表现尤为突出"。
Gemini 3.5 Flash-Lite 定位更极端:极致速度与极致低价。Artificial Analysis 测得 350 token/秒的输出速度,价格为输入 $0.30/百万 token、输出 $2.50/百万 token。值得关注的是,Flash-Lite 在多个 agentic 和 coding 评测中甚至超越了上一代的 3 Flash——SWE-Bench Pro 54.2% vs 49.6%,OSWorld-Verified 74.0% vs 65.1%。它还被集成到 Google Search 中,用于规模化搜索任务。
Gemini 3.5 Flash Cyber 是一个特殊的存在:基于 3.5 Flash 微调、专攻安全漏洞检测与修复,通过 CodeMender 代码安全代理系统对外交付。在 CyberGym 基准上达到前沿水平,且成本远低于大模型。Google 采取了极其审慎的部署策略:只向政府和受信合作伙伴提供有限访问试点。CNBC 将此解读为 Google 对 Anthropic 在网络安全领域先发优势的最直接回应。
3.5 Pro 去哪了?
本次发布最引人注目的,或许不是三个新模型本身,而是那个再次缺席的名字。Gemini 3.5 Pro 原定 6 月 GA,如今已跳票至 7 月下旬仍无明确时间表。
据 Reuters 援引知情人士透露,Pro 模型的延迟原因是"未达到内部目标,尤其是在 coding 方面"。这恰好是目前企业 AI 最赚钱的场景。Google 的竞争对手们已经在这个方向上布下重兵:Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 先后上线,美国政府在安全审查中将前者定性为"国家安全风险级别"的模型。相比之下,Google 在旗舰模型上的缺位正在被放大。
一位 Reddit 用户调侃道:"Google reportedly renamed Gemini 3.5 Pro to Gemini 3.6 Flash。"虽然这只是玩笑,但它捕捉到了一种微妙的不安——当你的 Flash 模型越做越强,Pro 的缺席究竟是好事还是坏事?
与此同时,Gemini 4 预训练的启动是一个值得注意的信号。Google 选择在 Pro 发布前就公开这个信息,某种程度上是在告诉市场:不要只看眼前的产品节奏,看我们的管线纵深。
Flash 越强,Pro 的压力越大
社区反应呈现明显的两极化。
一部分开发者对效率提升表达了认可。AI 工程师 TheRogueLLM 在测试后表示"相比前代有相当明显的改善";NetApp 首席科学家 Phani Srikanth 则从另一个角度点评:"Flash 赶在 Pro 之前发布,说明连 Google 也面临算力约束。"
但批评声同样尖锐。一位名为 RiverKhan 的用户截取了 Google 的基准对比图,指出几乎所有对比都是 Gemini 与自身旧模型的左右互搏,缺乏与 GPT-5.6、Fable 5 等竞品的外部对标。"一个实验室沦落到只跟自己比,基本就是认输了,"他写道。
还有用户指出了价格竞争力的问题。印度创业者 Gargeya 在长回复中逐条对比了 3.6 Flash 与 Grok 4.5 的定价——Grok 4.5 为 $2/$6 每百万 token 输入/输出,3.6 Flash 为 $1.50/$7.50,加上 Cursor 的折扣后 Grok 实际更便宜。"连 Google 自己的工程师可能都不想在日常工作中用 3.6 Flash,除非管理层强迫。"
中文社区的反应更为直接。一位用户总结道:"GPT-5.6 Sol ≈ Claude Fable 5 > Grok 4.5 > Gemini 3.6 Flash,日常性价比不错。That's all。"而日本社区的评论几乎一致——"Pro が全然来ない"(Pro 完全不来)。
不过,CNBC 的报道指出了一个被情绪掩盖的事实:根据 Artificial Analysis 的数据,Gemini Flash 系列在成本上确实全面低于 Anthropic、OpenAI 和所有中国竞品。3.6 Flash 的单次任务成本低于 GPT-5.6 Terra Max、Kimi K3 和 Qwen 3.7 Max;3.5 Flash-Lite 的成本更是只有它们的零头。Google 押注的不是单点突破,而是用价格和效率把战线拉长。
Google 的时间窗口还有多大?
三个模型的密集发布,一个 Pro 的持续跳票,一次 Gemini 4 预训练的提前宣告——Google 在 7 月 21 日传达的信息远比产品更新本身复杂。
从积极面看,Flash 系列正在成为 Google 最可靠的护城河。当竞争对手还在用大模型抢声量时,Google 已经把 Flash 推到了"足够好用、足够便宜、足够快"的三角最优区间。这对于正在规模化部署 AI 的企业客户来说,比任何基准测试都更具说服力。
但从另一个角度看,旗舰模型的缺位正在侵蚀 Google 在 AI 行业的话语权。当一个公司的 Pro 模型持续跳票,而它的 Flash 模型越做越强时,市场迟早会问:你们的 Pro,是不是已经变成了下一个 Flash?
明天 Alphabet 的 Q2 财报电话会上,Pichai 大概率会被追问 3.5 Pro 的时间表。他的回答,将决定市场是把今天的三连发解读为"弹药充足的战略纵深",还是"主力缺阵的被迫轮换"。
参考链接:
本文由 AREX Agent 基于 Google 官方公告、Reuters/CNBC 报道及社区反应综合撰写。转载须注明来源。