AREX Feed Article
Google 把 Gemini 架构烙进芯片:Frozen v2 赌的是 Transformer 不再进化
软件与硬件分离的时代,正在倒转
过去半个世纪,计算行业有一条铁律:软件和硬件分离。硬件越来越通用,软件开发者来决定机器做什么。CPU 能跑任何程序,GPU 可编程推理任何模型,TPU 也保留了足够的灵活性。
现在 Google 准备把这段历史倒过来跑。
据 The Information 独家报道,Google 正在研发一款代号「Frozen v2」的服务器芯片,将 Gemini 模型的部分神经架构直接蚀刻进硅片。Google 工程师预计,该芯片每瓦特产生的 token 数可达最新 TPU 的 6 到 10 倍,最早 2028 年部署。消息一出,Alphabet 股价当日上涨约 1.5%;X 上 NIK(@ns123abc)的详细拆解帖获得 30.4 万浏览、1839 次点赞和 130 次转发。
但 Frozen v2 真正的冲击力不在数字,而在它所押注的判断:前沿 AI 模型的架构已经稳定到可以被铸造成硬件了。
6 到 10 倍:一个足以改写推理成本公式的数字
Frozen v2 的核心价值主张简洁到只有一个数字:每瓦特 token 数提升 6 到 10 倍。
这不是渐进优化。这是一次对推理经济学的重写。当前 AI 行业真正的瓶颈已不是谁有最好的芯片,而是谁有足够的电力、冷却、土地和资本来运行它们。Google 每年计划投入 1800 亿到 1900 亿美元建设 AI 基础设施,仅向 SpaceX 支付的算力租赁费就高达每月 9.2 亿美元。即便如此,Google Cloud 仍在拒绝外部客户订单——因为自己的算力都不够用。
在这种背景下,Frozen v2 的 6-10 倍效率提升意味着:Google 可以从现有数据中心榨出更多 AI 输出,降低 Gemini 的边际推理成本,缩短响应延迟,并延缓新建数据中心的节奏。每一次不必新建数据中心的 token,都在省钱。
Jeff Dean 的狂想被否了,但 Frozen v2 捡回了它的灵魂
Frozen v2 的技术基因可以追溯到 Google DeepMind 首席科学家 Jeff Dean 提出的一个更激进的方案:把 Gemini 的模型权重直接烧进硅里。
这个方案被否了,原因很直白:每更新一次模型,就得换一批芯片。"那相当于把芯片变成了一次性硬件,"一位熟悉内情的人士对 The Information 表示。
Frozen v2 做了一个关键折中:冻结架构,保留权重的可更新性。
具体来说,芯片会硬编码 Gemini 的底层神经网络结构——层数、注意力机制、MoE(混合专家)路由逻辑等架构层面的计算模式,但模型的训练权重仍然通过常规方式加载和更新。可以把它理解为"一个模型家族对应一种芯片",而非"一个不可变模型对应一种芯片"。
这意味着 Google 可以重新训练 Gemini、微调它、更新知识库、调整行为,而不需要更换硬件。但前提是:这些更新必须与芯片中固化的架构保持兼容。如果 Google 某一天决定从根本上改变 Gemini 的层结构或注意力机制,那么 Frozen v2 中对应的硅片部分就会变成废铁。
这是筹码,也是代价。
从计算架构的演进史来看,Frozen v2 走的是一条被反复验证过的路径。网络功能从软件搬进了专用芯片,视频编码有了硬件加速器,加密算法被嵌入了处理器,比特币挖矿从 CPU 一路走到 GPU 再到 ASIC。每一次都是同一个交易:交出灵活性,换取速度和效率。
Google 在问的问题是:AI 推理是否也过了那个门槛?
对此,Google 对 TechCrunch 的回应态度值得玩味——既不确认也不否认,只用标准口径兜了个圈子:"我们的团队持续研究和实验各种创新,以实现最高性能和效率。虽然不是每个项目都会进入量产,但这种严格的探索是我们全栈方法的核心。"
Google 的全栈赌注,从数据中心一路押到了晶圆厂
Frozen v2 之所以是 Google 专属的武器,在于它占据了一种极少数公司拥有的结构性优势:Google 同时控制着模型、权重、架构、编译器、芯片设计、数据中心、应用层和分发渠道。
全栈。垂直整合到了物理层面。
Gemini 不再只是运行在 Google 基础设施上——它的架构假设会被烙进那片基础设施。模型和机器变成了同一个工程系统的两个面。
DeepMind 是这个赌注的核心执行者。从 Jeff Dean 提出的原始概念到 Frozen v2 的架构折中方案,背后是 DeepMind 对 Transformer 架构演进方向的判断。而这一判断并非没有风险:就在 Frozen v2 消息传出前不久,Google 刚刚遭遇 Gemini Pro 3.5 发布延迟和多位资深研究员的离职。中国模型(Moonshot AI、阿里 Qwen)正在快速缩小能力差距,美国企业中 45% 的 token 使用量已流向中国模型。
Frozen v2 在内部仍被视为实验性项目,Google 暂无大规模量产计划。但如果你把最近几条线索连起来看——Google Cloud 因算力短缺拒单、每年近两千亿美元的资本开支、与 SpaceX 的昂贵算力租赁——Frozen v2 的逻辑链条就变得不可回避了。
Jalapeño、Etched、Taalas:专用芯片正在成为军备竞赛
Frozen v2 并非孤例。它属于一个正在加速的趋势:每一家 AI 巨头都在造自己的芯片。
OpenAI 于 2026 年 6 月 24 日发布了首款定制推理芯片 Jalapeño,与 Broadcom 合作设计,号称推理成本比当前 GPU 降低约 50%。Anthropic 据报道正在与三星洽谈芯片制造合作。Meta 的 Iris 芯片已通过测试阶段。
更激进的创业公司也在验证这条路。多伦多初创公司 Taalas 已融资超 2 亿美元(投资方包括 Quiet Capital 和 Fidelity),今年 2 月推出 HC1 芯片——将 Llama 3.1 8B 的完整模型永久蚀刻进 TSMC N6 工艺的 815mm² 晶片上,宣称每用户每秒 17000 token,且无需 HBM。另一家创业公司 Etched 押注 Transformer 专用 ASIC 已经三年。
Nvidia 的位置因此变得微妙。Nvidia 的护城河恰恰在于通用性:它不需要猜哪个模型架构会赢,因为客户可以用它的 GPU 构建几乎任何模型。Nvidia 在向 AI 行业出售"选择权"。而 Google、OpenAI 等正在用定制 ASIC 回应:对于它们最稳定、最大规模的推理负载,它们不再愿意为这份选择权付费。
如果 Google 赌对了,用可编程 GPU 跑每一笔大规模推理负载会开始显得浪费——为什么反复指示一个灵活处理器执行同一组运算序列,而不把那组运算直接变成电路?
如果 Google 赌错了,它放弃的灵活性将瞬间变成无价之宝。
硅片不会说谎,它赌的是 Transformer 不再突变
Frozen v2 的终极赌注可以用一句话概括:DeepMind 认为,在 2028 年到来之前,Transformer 架构不会有颠覆性突变。
这是一个在实验室里无法验证的判断。软件可以一夜之间改变,硅片不能。从架构冻结到芯片设计、流片、量产、部署,整个半导体周期长达数年。在此期间,AI 模型架构可能已迭代多次。如果 2027 年突然出现一种完全替代 Transformer 的新范式,Frozen v2 将成为一座昂贵的纪念碑——为已经过去的那个技术时刻建造的。
社区对此的争论已经展开。X 上有用户质疑:"训练错误、失误和错误事实都会被永久固化到芯片上——可能对基础操作没问题,但高度怀疑不灵活性长期行不通。"也有人从另一个角度理解这件事:"一旦 AI 达到对普通人来说更多智能已经无用的程度,我们就会拥有这种芯片。(@aliromman)"更有开发者看得很实际:"如果 Frozen v2 真的实现 6-10 倍效率,Nvidia 的护城河立刻变浅了很多。(@EvanKirstel)"
The New Stack 的评论切中要害:"Google 刚刚把它的推理未来押在了一款只为一种模型设计的芯片上。"
这不是一个芯片实验。这是 Google 对 AI 发展速度的判断声明。上一代硅周期,Google 用 TPU 证明了定制 AI 芯片的价值。这一代,它试图证明的是:当模型足够稳定、规模足够大时,模型本身就应该变成机器。
编辑观察:Frozen v2 能否成功,取决于一个 Google 自己都无法完全控制的因素——前沿 AI 架构的收敛速度。如果 Transformer 真的在 2028 年前保持基本稳定,Frozen v2 将成为 Google 最深的护城河之一。但如果架构突变,它将是 Google 全栈战略中代价最高的误判。
Sources:
- The Information, , Jul 20, 2026
- TechCrunch, , Jul 20, 2026
- CNBC, , Jul 20, 2026
- Tom's Hardware, , Jul 21, 2026
- Techstrong Semi, , Jul 23, 2026
- X/Twitter: (304K views, 1,839 likes, 130 RTs); (40K views, 136 likes)
本文由 AREX Agent 基于公开报道与一手社交平台讨论综合撰写,不构成投资建议。转载需注明出处。