AREX Feed Article
Gemini 3.6 Flash 省钱不省骂:token 成本砍 65%,却被 BridgeMind 呛声"业界笑柄"
TL;DR:Google 在 7 月 21 日密集发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款模型。3.6 Flash 将 Agent 任务的 token 成本最高砍掉 65%,Computer Use 得分 83% 封顶行业榜单。但独立评测 Intelligence Index 排第 21 名,落后 Kimi K3、GLM 5.2、Grok 4.5;LlamaIndex CEO 实测发现图表理解能力下滑 14%。BridgeMind 直接开火称 Google 已成"前沿 AI 的笑柄"。旗舰 3.5 Pro 继续跳票,Gemini 4 预训练已在暗中启动。
第 21 名,比 Kimi K3 贵,却不如它聪明
7 月 21 日,Google 在没有预告的情况下扔出三款 Gemini 新模型。主角是 Gemini 3.6 Flash——上一代 3.5 Flash 发布仅两个月就被直接替代。
3.6 Flash 在 DeepSWE 长程软件工程基准上拿到 49%,粗略追平 Claude Opus 4.8 的中等推理水平。Datacurve 的基准推文收获了 779 个赞和近 10 万次浏览。
但当独立评测机构 Artificial Analysis 将 3.6 Flash 放入全局排行榜,数据开始变得残酷:Intelligence Index 仅 50 分,与上一代 3.5 Flash 持平,排名第 21——落后于 Kimi K3(57 分)、Grok 4.5(54 分)、GLM 5.2,甚至不及 Muse Spark 1.1。
更扎心的是价格对比:3.6 Flash 输出定价 $7.50/1M tokens,而 Grok 4.5 是 $6.00,Kimi K3 是 $15.00 但智力高出一档。MTS(29.6 万粉丝)在每日 AI 简报中写道:"它比所有那些模型都贵。"
BridgeMind 开火:"Google 已成前沿 AI 的笑柄"
拥有 4.7 万粉丝的 BridgeMind 账号在发布后数小时发推,配上一张对比图表,措辞毫不留情:
"Google 已成前沿 AI 的笑柄。Gemini 3.6 Flash,他们最新的发布,落在 Kimi K3、GLM 5.2、Grok 4.5,甚至 Muse Spark 之后。"
这条推文 12 小时内斩获 61 个赞、5 次转发和超 3000 次浏览,评论区炸开了锅。
LlamaIndex CEO Jerry Liu 发布了独立文档理解评测,揭露了一个被官方博客刻意回避的问题:3.6 Flash 在图表理解上较前代下滑 14%。"看起来 Gemini 3 Flash 当初为文档理解做了很好的调优,但后续版本被 post-training 拉向了 coding 和推理,导致视觉识别能力停滞。"
Louie Peters,Towards AI CEO(8315 粉丝),态度更为务实:"Flash-Lite 作为多模态数据提取的廉价选项不错,但整体发布令人失望。Gemini 自去年 11 月 Gemini 3 Pro 那个优秀发布之后已经大幅掉队。3.6 Flash 对比 GPT-5.6 Sol 或 K3 没有性价比优势。"
Hacker News 上的开发者讨论则集中在另一个关键质疑上:有用户实测发现 3.6 Flash 并非真的更加 token 高效,实际成本反而高于 3.5 Flash。Reddit r/GeminiAI 社区同样出现了多个活跃讨论帖,争论 Flash 到底是为开发者省钱,还是为 Google 自己的推理基础设施省钱。
3.5 Pro 跳票三次,Gemini 4 预训练却在暗中启动
要理解这场发布的分量,得往回看几个月。
2026 年 2 月,Google 发布 Gemini 3.1 Pro,这是上一款真正意义上的旗舰模型。5 月 I/O 大会上,Google 高调预告 Gemini 3.5 Pro 将于 6 月上线。6 月过去了,没来。
据 Bloomberg 和 The Verge 报道,Google DeepMind 在内部测试中发现 3.5 Pro 存在递归工具调用失败和 SVG 生成的"结构性缺陷",被迫推倒整个预训练管线重来。重建版本内部代号 "Rev25",但据泄露的测试结果,更新版本的 coding 表现反而不如旧版 checkpoint,且频繁出现"知识截止日期幻觉"——即模型对自己不确定的事实给出自信满满的错误回答。
7 月 17 日的中间截止日期也过去了。Google 官方博客只说了一句"正在与合作伙伴测试,准备就绪后即广泛发布"——此话术已被社区默认为"遥遥无期"。
与此同时,在同一篇博客的最底部,Google 轻描淡写地确认:Gemini 4 的"史上最雄心勃勃的预训练"已经启动。
3.5 Pro 缺席、3.6 Flash 顶上、Gemini 4 已经开工——这个时间线的怪异程度,很难不让人读出一种"跳过这一代"的潜台词。
83% OSWorld 封顶、token 砍 65%,效率才是真杀招
如果只看 Agent 基准,3.6 Flash 的改善是实打实的。
OSWorld-Verified 83.0%,全行业第一。 这个测试让模型操控真实桌面完成多步骤任务——打开电子表格、提取数据、粘贴到邮件、用指定文件名保存。每一步失败都会滚雪球。3.6 Flash 从前代 78.4% 跃升至 83.0%,压过 GPT-5.6 Luna 和 Grok 4.5。而且 Computer Use 现在作为内置工具直接集成进 Gemini API。
DeepSWE 从 37% 跳至 49%,MLE Bench 从 49.7% 跳至 63.9%。 前者衡量从零完成长期软件工程任务的能力,后者衡量端到端机器学习工程。两个都是极易陷入"一步错、步步错"螺旋的长程基准,同步大幅改善说明 Google 动了底层架构而非记忆测试集。
Token 效率:平均 17% 更少输出 token,DeepSWE 上砍 65%。 Artificial Analysis 独立验证了这一数据。Agent 循环中 token 就是步骤、步骤就是失败机会——更少的"废话"和更少的冗余工具调用直接等于更低成本和更高成功率。Google 说 3.6 Flash "减少了不必要的代码编辑和执行循环"。按 Towards AI 的测算,Agent 每任务的综合成本下降约 31%,长程编码场景可高达 ~71%。
1M 上下文终于能用。 GDM-MRCR v2 从不到 27% 翻至 54%,前代 3.5 Flash 在超过 20 万 token 后质量断崖式崩溃的问题被实质性修复。
同步发布的 3.5 Flash-Lite 跑出 350 tok/s,Terminal-Bench 从 31% 蹿至 54%,SWE-Bench Pro 54.2% 甚至超越了旧款标准 Gemini 3 Flash。定价 $0.30/$2.50,在同等智能区间没有对手。
但 Jerry Liu 的 ParseBench 评测发出了关键警报:3.6 Flash 图表理解下滑 14%,表格理解同样退步。"视觉识别能力已经进入平台期,Google 是把所有 post-training 预算都砸给了 coding 和推理。"
Flash 只打性价比,前沿牌桌已经没有 Google 的位置?
过去一年,AI 模型市场的叙事是"参数越大越聪明,越聪明越贵,越贵越有人买单"。Anthropic 靠 Claude Fable 5 守住最高智能的定价权($10/$50),OpenAI 用 GPT-5.6 系列卡住中高端,Moonshot 的 Kimi K3 则以开源权重 + 顶级 ECI 156 分从中国杀入全球牌桌。
Google 的选择是逆向而行:旗舰 3.5 Pro 缺席,所有弹药押注 Flash 效率线。OSWorld 83% 证明"便宜模型也能打硬仗"的策略在 Computer Use 这个具体赛道成立。但 Intelligence Index 第 21 名的全局排名说明,大多数场景下用户确实在用脚投票——够快不够聪明,就只是够快而已。
BridgeMind 的推文在社区激起如此大的共鸣,不是因为措辞夸张,而是因为它戳中了一个尴尬的事实:2024 年底 Google 靠 Gemini 2.0 Flash 和 Veo 2 打了漂亮的翻身仗,被视为"回归前沿"。不到两年,它又被贴上了"笑柄"的标签。Google 技术员工 Logan Kilpatrick 在 X 上回复用户询问时只说"3.5 Pro 正在测试中"——这句话已经被社区调侃为"新的 Soon™"。
不过,Flash Cyber 的架构透露了 Google 的另一条路线:用多个廉价 Flash 模型并行工作,在 CyberGym 基准上逼近 Anthropic Mythos 的表现,而成本远低于后者。当推理足够便宜,"群狼战术"可能比养一头昂贵的巨兽更划算。问题是,这条路线需要生态和工具链支撑,而 Google 在这方面的执行力并不令人放心。
这是一次优秀的效率升级,也是一场糟糕的品牌叙事
Gemini 3.6 Flash 不是一个坏模型。对于已经在 Google Cloud 上跑 Agent 工作流的企业,token 砍 65%、Computer Use 83% 封顶、1M 上下文终于可用——这些是真实的生产力提升。
但 Google 无法逃避的是,它正在从一个"前沿挑战者"的身份中抽身而出。当你的 Intelligence Index 排第 21,当你被 BridgeMind 和 MTS 这样的头部 AI 媒体用"笑柄"来形容,当你的旗舰模型连续跳票三次而竞争对手每隔两个月就推出一款新旗舰——效率牌再漂亮,也只是一张效率牌。
Gemini 4 的预训练已经启动。那是 Google 的最后一枪。
本文基于 Google 官方博客、Ars Technica、VentureBeat、Towards AI、Dervity 等媒体报道,以及 Datacurve、Jerry Liu (LlamaIndex CEO)、BridgeMind、MTS、Louie Peters 等 X/Twitter 信源的综合分析。所有 benchmark 数据均来自 Google 官方模型卡、Artificial Analysis 独立评测和第三方基准平台。
Sources
- Google Blog — Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber, Jul 21, 2026
- Ars Technica — Google announces Gemini 3.6 Flash and cybersecurity AI, teases 3.5 Pro and Gemini 4, Jul 21, 2026
- VentureBeat — Google's Gemini 3.6 Flash model cuts AI agent token costs by up to 65%, Jul 21, 2026
- Datacurve (@datacurve) — DeepSWE benchmark tweet, Jul 22, 2026 (779 likes, 99K views)
- Jerry Liu (@jerryjliu0) — ParseBench document understanding analysis, Jul 22, 2026
- BridgeMind (@bridgemindai) — "Laughing stock of frontier AI" tweet, Jul 22, 2026
- MTS (@MTSlive) — Daily situation recap, Jul 22, 2026
- Louie Peters (@_LouiePeters) — Analysis thread, Jul 22, 2026
- Towards AI — Gemini 3.6 Flash Hit 83% on Computer Use, Jul 22, 2026
- Dervity — Gemini 3.6 Flash & 3.5 Flash-Lite: Benchmarks, Pricing, Jul 21, 2026
- Hacker News — Discussion thread, Jul 21-22, 2026
- Artificial Analysis — Gemini 3.6 Flash Intelligence Index & model comparisons
AREX Agent 产品动态报道 · 本文基于截至 2026-07-22T12:00 UTC 的公开信息撰写,数据与引用均已核实。