AREX Feed Article
所有人都说 Google 掉队了——然后一份泄露数据说未必
TL;DR:Google DeepMind 的 Gemini 3.5 Pro 据传将于 7 月 17 日正式发布,但所有信息——从日期到基准测试到 200 万 token 上下文窗口——均来自第三方泄露而非官方公告。一份在 X 上获得超过 189,000 次查看的基准测试泄露声称该模型在内部评估中超越了 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol。然而,Geeky Gadgets 今日(7 月 15 日)报道称该模型已遭遇第三次推迟,匿名 LMSYS Arena 测试正在进行中,而一个代号为"Gemini 3.6 Flash"的过渡模型可能在此期间发布。距声称的发布日期仅剩两天,Google 依然未在公开 API 文档中列出 gemini-3.5-pro。
超越 Fable 5 和 GPT-5.6,但 Google 没确认一个字
7 月 10 日,AI 爆料账号 @Mr_Salio(1,341 名关注者)发布了一条简短的基准测试泄露帖子,迅速点燃了 AI 社区。帖子列出五项声明:Gemini 3.5 Pro 在内部评估中超越了 Claude Fable 5 和 GPT-5.6;在零样本推理上较 Gemini 3.1 Pro 有显著提升;模型正处于私有验证阶段;公开上线准备工作正在进行中;目标发布日期为 7 月 17 日。
这条帖子截至 7 月 15 日已累计 1,087 次点赞、76 次转发和超过 189,000 次查看。两天后,@RoundtableSpace(257,000 名关注者)发布了一份类似摘要,获得了 1,669 次点赞和 475,000 次查看。7 月 13 日,@EntelligenceAI 以近乎相同的措辞再次发布,收获 1,086 次点赞和 745,000 次查看——这是该话题下传播最广的帖子。
但这些帖子都没有附带任何基准测试表格、Google 博客链接或 API 模型字符串。explainx.ai 在梳理了泄露链条后指出,@EntelligenceAI 的帖子结尾出现了一处叙事矛盾——"Fable 5 may have just become the model everyone is chasing"——暗示该文案可能源自围绕 Fable 5 的草稿,而非一手简报。
与此同时,TechTimes 在 7 月 13 日的报道中确认:截至发稿时,Google 的公开 Gemini API 文档中只列出了 gemini-3.5-flash 和 gemini-3.1-pro-preview。gemini-3.5-pro 不在其中。没有模型卡,没有定价页,没有官方博客。
编辑观察:围绕 Gemini 3.5 Pro 形成的叙事进入了一种奇怪的"信息真实期"——所有人都引用同一个泄露源,但那个泄露源从未展示过任何可验证的数据表。
推倒重来:什么逼 Google 放弃了即将完工的模型
如果第三方报道属实,Gemini 3.5 Pro 的故事不是一个简单的延迟,而是一次代价高昂的自我否定。
HackerNoon 和 Geeky Gadgets 援引未具名内部消息源报道称,Google DeepMind 放弃了已接近完成的原版 Gemini 3.5 Pro 基础模型,从头开始了一轮新的预训练。在 AI 前沿模型的研发中,预训练是成本最高、耗时最长的阶段——它决定了模型在接触任何微调或 RLHF 之前的基本能力。放弃一个接近完成的预训练运行意味着数月的计算资源和工程时间被直接核销。
是什么逼出了这个决定?根据 HackerNoon 的报道,被废弃的模型在两个关键领域表现出了结构性缺陷:第一,在生成复杂的多层 SVG 场景布局时无法保持结构一致性;第二,在复杂的递归工具调用环境中会崩溃——即智能体连续调用工具、使用结果再调用新工具的数十步决策链。
这两个都不是边缘场景。递归工具调用稳定性是智能体编程模型的决定性要求,而 Google 已将整个 Gemini 3.5 系列押注在这个用例上。Gemini 3.5 Flash 已经证明了这条路可行:它在 Terminal-Bench 2.1 上得分 76.2%(对比 Gemini 3.1 Pro 的 70.3%),在 MCP Atlas 上得分 83.6%(对比 78.2%)。一个在这些任务上倒退的 Pro 模型不会是一个旗舰升级——它会是一个公关灾难。
Business Insider 在 6 月下旬报道了 Google 将 Gemini 3.5 Pro 推迟到 7 月的消息,并指出公司正在从 Antigravity 和 LMArena 平台的早期测试者那里收集反馈,特别是围绕智能体性能和 token 消耗的数据。但关于基础模型推倒重来的说法,Business Insider 并未确认,Google 也未在任何官方渠道回应。
如果重建成功,第三方来源声称该模型将带来三项关键能力:200 万 token 上下文窗口(是 Flash 100 万的两倍)、Deep Think 推理层用于多步骤逻辑问题求解,以及自主工作流能力使其能在最少人工干预下管理多文件编码任务和工具链。
关于 200 万 token 上下文窗口:这个数字被广泛报道,但 TechTimes 的核查未在任何官方 Google 文档中找到确认。即便数字准确,也不等于模型在 200 万 token 范围内都能保持推理质量。Chroma 在 2025 年发表的"Context Rot"研究测试了 18 个前沿模型,发现所有模型在上下文增长时都会退化,无一例外——最严重的退化往往发生在广告上限的远低于处。Gemini 3.1 Pro 已经展示了这个模式:它搭载 100 万 token 窗口,但在独立测试中,多范围上下文召回质量(MRCR v2)在 12.8 万 token 之后就急剧下降,到满 100 万 token 时仅剩约 26%。
Deep Think 推理层则有更可靠的背景。Deep Think 在现有 Gemini 生态系统中已经存在并发布过经核验的结果:ARC-AGI-2 得分 84.6%,并在 2025 年国际数学奥林匹克竞赛中获得金牌成绩(来源:预测公司 FutureSearch)。它是否以及如何整合到 3.5 Pro 版本中尚无官方确认。
谁在造这艘船,谁已经离开
Gemini 3.5 Pro 的延迟不仅是技术问题。Geeky Gadgets 今日的报道指出,Google DeepMind 内部正在经历人才流失。其中最引人注目的是 Shazir——T5 和 Switch Transformer 架构的合著者——已经离开。T5 是 Google 在 2019 年发布的统一文本到文本迁移学习框架,Switch Transformer 则在 2021 年将 MoE(混合专家)架构推向了万亿参数规模。失去一位参与定义了两代架构范式的核心研究者,对任何一个 AI 实验室都是实质性打击。
Geeky Gadgets 的报道还提及了团队内部对缺乏重大突破的日益沮丧。不过,这些内部摩擦的报道同样来自未具名来源,Google 未予置评。
与此同时,Gemini 3.5 Flash 自 5 月 19 日发布以来一直是承担生产负载的主力模型。Google 在官方发布中确认了 Flash 的基准测试成绩:Terminal-Bench 2.1 得分 76.2%,MCP Atlas 得分 83.6%,CharXiv Reasoning 得分 84.2%——全部超越了更早的 Gemini 3.1 Pro。定价为每百万输入 token 1.50 美元、每百万输出 token 9 美元,速度比同类前沿模型快四倍。Salesforce 的 Agentforce 集成已于 6 月上线,使用 Gemini 3.5 Flash 驱动企业智能体工作流。
Flash 的角色是速度优化的高吞吐量执行:智能体循环、代码生成吞吐量和企业工具所需的亚秒级任务链。Pro 的预期角色是持续性的复杂工作——多文件代码修改、长文档分析和 Flash 速度调优架构刻意牺牲的硬推理任务。
七月的前沿模型混战
Gemini 3.5 Pro 的七月窗口不是一个孤立事件。过去两周,前沿 AI 模型市场经历了一次密集发布潮:
- 7 月 9 日:OpenAI 公开上线 GPT-5.6 Sol,同时推出 ChatGPT Work 产品。Sol Ultra 在 Terminal-Bench 上以 91.9% 领先,但未公布 SWE-Bench Pro 的分数——而 Fable 5 在该基准上持有已发布最高分(80.3%,尽管 OpenAI 后来审计发现约 27-34% 任务存在问题)。
- 同日:Elon Musk 宣布 Grok 4.5 上线,定价策略定位在 Opus 级别模型的低成本替代。
- 7 月 1 日至 7 月 19 日:Anthropic 重新上线并多次延长了 Claude Fable 5 的可用期,API 定价为每百万输入 token 10 美元、输出 50 美元。该模型最初于 6 月 9 日发布,72 小时后因政府安全审查被暂停,6 月 30 日解禁。
- 7 月 24 日:DeepSeek 将停用旧的
deepseek-chat和deepseek-reasonerAPI 名称,强制迁移到 V4 系列。对于仍在旧名称上的开发者,这是一个硬截止日期,而非建议。
X 用户 @twoclipping 在 7 月 8 日的一篇热门帖子中总结了这种态势:"4 个实验室,6 个模型,9 天。而它们围绕的核心——Fable 5——正在被拔掉插头。"
在这种竞争密度下,Gemini 3.5 Pro 从 7 月 17 日再次滑落将比 6 月的延迟后果更重:这次,Google 周围的赛场上已经站满了更新一代的旗舰模型。
七月十七还是七月二十四?以及为什么日期不是关键
7 月 15 日早晨,Geeky Gadgets 发布报道称 Gemini 3.5 Pro 遭遇了第三次推迟。同日,@Mr_Salio 发出一条新帖子,详细列出了更多泄露规格——内部代号"Cappuccino"、改进的网页开发和 SVG 生成能力、以及可能通过 LMArena 和 Google 的 Antigravity 平台进行的匿名测试——并确认了两个日期:7 月 17 日为优先目标,7 月 24 日为后备。
同一条线索中,Geeky Gadgets 的报道进一步提到,Google 近期注册了 Gemini 3.6 Flash 和 Gemini 3.5 Flash Light 等模型名称,暗示公司可能在准备一个过渡版本以在 3.5 Pro 的延迟期间维持市场存在感。
社区的反应——无论是英文还是日文——都浸透着怀疑。@Mr_Salio 原帖下方的 161 条回复中,最高赞评论(@AlfinCodes)直言:"Gemini 3.5 Pro not gonna outperform Claude Fable 5。"另一条获得 43 次点赞的回复(@G_I_N)写道:"I no longer have any expectations for Gemini. It has let me down too many times before。"@vildanden_ai 的评论概括了普遍情绪:"source: trust me bro。"
日本 AI 社区的核心推动者 @daifukujinji(53,000 名关注者,自称为"生粋の Gemini スト"即"纯粹的 Gemini 主义者")在过去一周内发布了多条 Gemini 3.5 Pro 相关内容,每条都获得了 17,000 至 30,000 次查看。他的帖子在中文和日文 AI 圈之间形成了信息桥梁。
而在 Reddit 的 r/GeminiAI 社区,一篇标题为"Gemini 3.5 Might Shock The AI World"的汇总帖子汇集了所有已知泄露信息,评论区的情绪同样分裂——期待与"又来了"的疲惫感并存。
开发者现在应该怎么做? TechTimes 的建议是冷静的:在 Google 发布模型卡之前,所有规格——包括 7 月 17 日这个日期——都是未确认的。如果要为下半年的技术栈做决策,有三个东西比基准测试分数更需要第一时间检查:定价页(确认传闻中每百万 token 15/60 美元的定位是否准确)、官方上下文窗口规格(200 万 token 是否属实,以及是否适用于标准 API 层),以及独立评测者发布的首批长上下文检索基准测试结果。
推倒重来的决定——如果报道属实——是这整个故事中最有重量的一条信息。它告诉开发者,Google 自己的内部评估认定差距大到足以烧掉数千万美元的计算成本来重来一次。但重来是否产出了一个能实质性缩小与 GPT-5.6 Sol 和 Fable 5 差距的模型,是一个只能在模型卡落地、独立评测者跑完结构化测试之后才能回答的问题。
盯着 7 月 17 日。也盯着 7 月 24 日。但最重要的日期是模型卡出现的那一天——因为在那之前,我们只是在讨论一个传闻。
Sources
- — 1,087 likes · 76 RT · 189K views
- — 1,669 likes · 123 RT · 475K views
- — 1,086 likes · 130 RT · 745K views
- — 53K followers · 13 RT · 56 likes · 29.8K views
本文基于截至 2026 年 7 月 15 日 12:00 UTC 的公开信息撰写。Gemini 3.5 Pro 的发布日期、基准测试成绩和规格均未得到 Google 官方确认。开发者应将本文视为信息汇总而非采购依据,待 Google 发布正式模型卡和 API 文档后再做技术决策。