AREX Feed Article
Gemini 3.5 Pro 三度跳票:新 checkpoint 不敌旧版,2M 上下文窗口死磕 7 月下旬
7 月 11 日,Gemini 3.5 Pro 的发布时间表出现了最不愿被看到的新变数。同一个泄露源在 24 小时内连续更新了两条相互矛盾的消息:7 月 10 日仍指向 7 月 17 日的 GA,7 月 11 日便改口为"7 月下旬或更晚"。更令人不安的是补充说明——新版 checkpoint 在多项指标上跑不赢 5 月的旧版。
这已经是 Gemini 3.5 Pro 的第三次推迟。从 Sundar Pichai 在 I/O 舞台上说的"下个月见",到 6 月的沉默,再到 7 月 17 日目标,如今又滑向未知。
但规格本身没有缩水。据泄露信息,Gemini 3.5 Pro 是一张彻底新建的基座——不是 2.5 Pro 的适配,而是一次完整的全新预训练。2M token 上下文窗口、Deep Think 推理模式、$1.25 输入 / $10 输出的百万 token 定价——这三张牌如果同时打出,Google 打的就不是 benchmark 榜,而是工作负载迁移战。
社区分裂:有人喊"回来吧 Google",有人说"又被鸽了"
Gemini 3.5 Pro 泄露帖在 X 上收获了 1,083 次点赞、76 次转发和 18.4 万次浏览——但评论区远比数据本身更能说明问题。
质疑声浪占据上风。"我对 Gemini 已经没有任何期待了,它让我失望太多次了,"用户 @G_I_N 在回复中写道,这条评论获得了 43 次点赞——在所有回复中排名第二。另一位开发者 @DragonStacker 措辞更尖锐:"Gemini 和 Antigravity 的产品管理一直是个灾难,每次发布都伴随着公然虚假的宣传。"@Waguri_Kaoruko8 直接指称泄露数据造假:"有信源显示,当前 3.5 Pro 版本在任何维度都没有超越 Fable 5 和 GPT-5.6。"
但看好派也没有沉默。用户 @_RanjanSoni 写道:"Google 是这个赛道上沉默的老虎。"原帖发布者 @Mr_Salio 在回复中逐一回应,坚持 7 月 17 日的窗口——直到第二天他自己发出延迟更新。
值得注意的是社区对定价的敏感度。用户 @KrakenUnbound 的评论收获了 18 次点赞:"如果 Sol 或 Fable 只好了 2% 但贵了 50%,我会用 Gemini。跟一年前所有模型比起来,一切都变得更好了。"这恰恰印证了 Google 的核心策略:赢在性价比而非绝对 benchmark。
从 I/O 承诺到人才出走:为什么 Google 退无可退
5 月 19 日 Google I/O 上,Sundar Pichai 面向开发者自信表态——"给我们一个月"。一个月过去了,Gemini 3.5 Pro 没有来。
6 月 18 日,Gemini 联合负责人、"Attention Is All You Need" 论文合著者 Noam Shazeer 宣布加盟 OpenAI。次日,诺贝尔奖得主、AlphaFold 背后的九年 DeepMind 老将 John Jumper 宣布加入 Anthropic。连带两名资深研究员的离职,Alphabet 股价在 6 月 22 日单日暴跌 5%,市值蒸发约 2,250 亿美元。
人才流失的背景叠加模型延迟,让 Gemini 3.5 Pro 从一个产品发布变成了 Google AI 信誉的背水一战。而 7 月 9 日,OpenAI 按计划交付了 GPT-5.6 三兄弟——Sol、Terra、Luna——Cerebras 晶圆级硬件上的 Sol 跑出了 750 token/秒,直接把推理速度的行业标准拉升了一个数量级。
因此,Gemini 3.5 Pro 已不是在跟 GPT-5.5 比,而是在跟已经上线的 GPT-5.6 和 Anthropic 的 Claude Fable 5 比。它的竞争对手不是"即将到来",而是"已经在这里"。
2M 上下文 + $1.25 定价:Google 打的不是 benchmark 牌
泄露的规格指向一个清晰的竞争策略:Google 不打算在 benchmark 天梯上硬刚 Sol 和 Fable 5,而是要在三个实际维度上建立差异化。
第一,2M token 上下文窗口。当前前沿模型的上下文上限是 1M token(GPT-5.6 Sol、Gemini 2.5 Pro、Claude 系列),Gemini 3.5 Pro 若真能实现翻倍,意味着一整个多人团队代码库加文档加 PR 历史可以塞进一次推理。Transformer 注意力机制与序列长度呈平方关系,2M token 的实际工程难度远超翻倍算力。但能否在全窗口范围内保持检索质量——Stanford 等机构已多次证明模型在超长上下文的"中间 50%"区域性能会显著衰减——仍是独立评测才能回答的问题。
第二,API 定价。$1.25/百万输入 token 对比 GPT-5.6 Sol 的 $5——输入端的 4 倍价差。Gemini 3.5 Flash 目前定价为 $1.50/$9.00,Pro 的输入价甚至低于 Flash。这意味着 Google 在用 Flash 和 Pro 构建一条从轻量到重量、价格梯度清晰的产品线。输出端 $10 对比 Sol 的 $30,3 倍差距。对高频 agent loop 或长文档处理场景,这组数字的月账单差异不是百分比级别,是倍数级别。
第三,Deep Think 推理模式。这个功能将是 Pro 的标配,但消费端被锁在 $250/月的 Ultra 订阅后面。Google 在复制 OpenAI 的 Pro 订阅分层策略,同时试图说服 API 开发者:Pro 一个模型就能覆盖从快思考到慢推理的全部需求,不需要像以前一样分别调用 Pro 和 Deep Think SKU。
三张牌的逻辑高度一致:让开发者为"实用价值"买单,而非为"跑分优越感"付费。
GPT-5.6 和 Fable 5 已经上桌,Gemini 的座位还在等人
过去两个月,AI 模型竞争格局发生了不可逆的位移。
此前,前沿模型的竞争轴心是 benchmark 排名:Humanity's Last Exam、SWE-Bench Pro、ARC-AGI-2——谁在这些榜单上登顶,谁就赢得了叙事。Gemini 3.5 Flash 在 HLE 上得分 40.2%,落后 Opus 4.7 的 46.9% 和 GPT-5.5 的 41.4%,这已经让 Google 在"推理能力"这个叙事维度上落后了整整一个身位。
转折发生在 7 月 9 日。GPT-5.6 Sol 以 88.8% 标准 / 91.9% Ultra 的 Terminal-Bench 2.1 成绩上线,Terra 以 $2.50/$15 定价在 Claude Fable 5 同等水平上打出半价。同一天,Anthropic 的 Fable 5 也已回归市场。算上 7 月初上线的 Grok 4.5,开发者在 72 小时内被塞进了三个旗舰模型的选择题。
在这个时间窗口里推 Gemini 3.5 Pro,Google 面临的不是"能不能赢"的问题——是"能不能入场"的问题。BuildFastWithAI 主编在 7 月 12 日的行业综述中写道:"如果定价属实,Google 不是在尝试赢得 benchmark 头条,而是在尝试赢得工作负载迁移。$1.25 输入价配 2M token 上下文,整个 RAG 架构类别会因此变得更简单——直接把语料塞进 prompt 就行了。"
行业分析师 Caspar Bannink 在 Towards AI 的评论提供了一个更冷静的总结:"Gemini 3.5 Pro 是 Google 2026 年最有趣的发布,因为泄露的信息恰好对齐了 Google 最需要回归的维度。它不会在推理排行榜上推翻 Fable 5,也可能不会在原始 benchmark 上追平 GPT-5.5。但在开发者日常工作的维度——视觉代码、长上下文、图像编辑、agent 基础设施——这次发布最终给了 Google 一个重新坐到前排的合理理由。"
这不是一场 benchmark 赛跑,而是一次生态位争夺
第三次推迟的消息——尤其是"新 checkpoint 不如 5 月旧版"这条细节——把 Gemini 3.5 Pro 的叙事从"能不能打"扭回了"能不能生"。但即使带着伤痕进场,这套规格背后是一个清晰的逻辑:Google 从未打算在这场模型大战中靠跑分赢,而是靠"最多的上下文、最低的输入成本、最完整的内置 agent 工具链"来争夺一个不属于 OpenAI 也不属于 Anthropic 的生态位。
这个生态位能不能成立,取决于 7 月下旬 Google 手上拿出的究竟是 5 月的旧 checkpoint,还是一个真正驯服了新基座的 Pro。
本文基于截至 2026 年 7 月 12 日 12:00 UTC 的公开信息撰写。Gemini 3.5 Pro 的所有规格、定价和发布日期均来自第三方泄露,未经 Google 官方确认。
Sources:
- ,1,083 likes, 76 retweets, 184K views
- ,132 likes, 9.5K views
- ,lead industry roundup, item #4
- ,by Caspar Bannink
- _