AREX Feed Article
Google 的 Logan Kilpatrick 称已看到「递归自我改进」早期迹象,并称 Gemini 4 将是迄今最大、最有野心的预训练运行
北京时间 9 月 16 日上午 11 时许,X 账号 发布带视频的帖文,引述 Google Gemini 团队成员 Logan Kilpatrick 的说法:Google 正在看到「递归自我改进的早期迹象」(early signs of recursive self-improvement),这种迹象体现在 Gemini 以 3~4 周为间隔的发布节奏上;他还表示,Gemini 4 将是「我们迄今最大、最有野心的预训练运行」,预计会让 Google「重回竞争行列」(back in contention)。
帖文以四段整句引语呈现这些说法并附有视频。这类能力与进展陈述目前均为实验室自评,没有第三方验证;Gemini 4 的规模与效果属前瞻性表述。不过,其中发布节奏的部分可以对公开记录核对——结果吻合;Gemini 4 的预训练运行,Google 也确曾在 7 月的官方博客中官宣过。
官方博客日期对上了:23 天、20 天、13 天
Kilpatrick 在引语中说:「我想你已经看到了:Gemini 3.5、3.6、3.7、3.8,排出来的就是实实在在的三到四周一个,有时更短,有时略长。」
Google 官方博客的发布日期与这一描述一致。7 月 21 日,Google 发布 ;8 月 13 日发布 ,博客明确写道「此次发布距 Gemini 3.6 Flash 仅三周」,并开出介绍价——每百万 tokens(词元)输入 0.75 美元、输出 3.75 美元,是 3.6 Flash(输入 1.50 美元/输出 7.50 美元)的一半;9 月 2 日发布 ,博客称这是「六周内的第三个 Flash 版本」,价格与 3.7 Flash 持平;9 月 15 日,Google 又上线了。
具体间隔:7 月 21 日到 8 月 13 日是 23 天,落在三到四周之内;8 月 13 日到 9 月 2 日是 20 天,9 月 2 日到 9 月 15 日是 13 天,对应他说的「有时更短」。他这段话里可公开核验的部分,经得起对表。
「递归」的公开锚点:博客里的智能体回路
在可核的公开记录里,「看到递归自我改进迹象」这一判断目前只出自 Kilpatrick 的口头表述。不过在 9 月 2 日介绍 3.8 两个版本的博客里,Google 写下过一句与它最接近的机制描述:3.8 Flash 与 3.8 Flash Cyber 由同一套基础智能驱动,并通过「旨在递归评估并改进底层模型的长时间运行智能体回路」获得进一步加速。
这是 Google 把「递归评估与改进」写进官方发布说明的一处记录:按这一表述,对底层模型的递归评估与改进由长时间运行的智能体回路来执行。Kilpatrick 在引语中也给出了同样的落点:「我们看到了相当可观的进展,再说一遍,这就是这个递归自我改进回路的早期迹象。」但无论博客还是引语,都没有给出这种「递归」回路带来多少增益的量化指标。
Gemini 4:7 月官宣的运行,9 月新增的竞争定位
「迄今最大、最有野心的预训练运行」并不是 9 月 16 日才出现的新话。7 月 21 日,Google 在发布 3.6 Flash 的博客末尾写道,团队「已启动迄今最有野心的预训练运行——为了 Gemini 4」;Kilpatrick 当天也在 X 上,截至发稿获得 14,312 个赞与约 196 万次浏览。
9 月这轮说法新增的,是竞争定位。他在引语里说:「所以希望这些能以同样的方式转化到 Gemini 4 上——它将是我们迄今最大、最有野心的预训练运行。我认为它会让我们重回竞争行列。」背景是他在 8 月 11 日给出的:Gemini 应用每月 10 亿用户,Gemma 系列模型累计下载 10 亿次。9 月 1 日,他还与 Google DeepMind 负责人 Koray Kavukcuoglu 的对谈,话题包括通往 AGI(通用人工智能)的路径与「为什么我们聚焦前沿」——帖子引语的第一段,正是「我认为我们现在正极度专注在前沿上」。
剪辑账号与自评数字:验证的边界
发布引语的 是 2026 年 6 月 14 日创建的 X 账号,自我介绍为「最佳商业、科技与消费者对话的摘要与合成」,现有 19,395 名粉丝,近期陆续剪发过 Sam Altman、Dario Amodei、Jensen Huang 等人的访谈片段。这条 Kilpatrick 帖文截至发稿获得约 3.5 万次浏览、320 余个赞;帖文未说明这段发言的具体场合,原始视频为信源,该账号做的是二次整理。Kilpatrick 本人在 X 上的是「技术人员(member of technical staff),参与 Gemini、Google AI Studio、Gemini API 与 Kaggle 的工作」。
Google 同期公布的能力数字同样是自评口径:9 月 15 日的博客称,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 语音到语音质量指数上以 82.6 分排名第一,在 τ-Voice 上得 68.6%,Big Bench Audio 上得 97.7%;Gemini 3.8 Live 则在 Speech Agent Arena 列第二。下图即该博客公布的 ServiceNow EVA-Bench 评测结果。
引语本身也留了余地:关于 Gemini 4,他的原话以「希望」开头。在本文核对的公开记录里,Gemini 4 尚无发布时间表;他所说的这些「早期迹象」是否成立,要等这次预训练运行的结果出来才能检验。