AREX Feed Article
Fugu 换脑成功:Sakana AI 用 Gemma 4 重训指挥者,准确率 0.91 持平 Qwen 版
Sakana AI 于 8 月 10 日公布了一项:其 Fugu 编排系统的指挥者模型用 Google Gemma 4 E2B 重新训练后,在自建评测集上取得 0.91 的准确率,与基于 Qwen 的既有版本(0.92)几乎持平,成本效率同样维持在随机调度基线的 0.68。
这回答了 Fugu 架构的一个关键问题:编排层的训练方法是否绑定特定基座模型。答案是不绑定。Sakana AI 同时宣布,下一步将基于日本国内预训练模型构建指挥者,以满足企业 AI 主权需求。
换模型不换性能,摊开了 AI 主权的一张底牌
Sakana AI 的官方账号在 X 平台用日文发布了这篇博客,截至 8 月 12 日获得了 333 次喜欢和 30 次转发。推文称,模型池从一开始就设计为可替换,此次则进一步验证了指挥者模型同样可以用 Gemma 4 重训且性能不减,今后将基于自社开发模型构建指挥者,「根据所要求的主权性条件,提供模型编排的潜力」。
日本开发者社区的反应集中在主权 AI 的意义上。X 用户 评论称:「Sakana Fugu 展示了指挥者模型换成 Gemma 4 基座后性能仍可维持。模型编排作为不依赖单一模型的主权 AI 基础设施,值得持续关注。」另一位用户 则对「国产 AI」的标签表达了保留态度,认为基座仍来自海外模型。
AI Weekly 在中指出,Sakana AI 刻意保持了低调:「不是能力的飞跃,而是编排训练方法可跨模型谱系迁移的证据」。StartupHub.ai 也在中将此事件定性为「迈向基座无关编排的重要一步」。
Fugu 的指挥者不需要知道一切,只需要知道该找谁
要理解这次验证的意义,需要先看清 Fugu 的二层结构。,Sakana AI 正式发布了 Fugu,一款以单一模型 API 形态交付的多智能体编排系统。其设计基于两篇 ICLR 2026 论文(Trinity 与 Conductor),系统由两层构成:
指挥者模型是一个小型语言模型,Sakana AI 训练它学会「模型之间如何协作」:判断一个请求该交给谁处理、如何组合结果。模型池是真正执行任务的模型群,包含数百 B 参数级别的前沿模型,且从一开始就设计为可自由替换。
指挥者不需要在自身权重中装下所有知识。重推理、重知识的部分由池中模型承担,因此指挥者可以很小,训练成本也足够低——低到可以反复训练,甚至换一个基座重来一遍。
模型池的可替换性此前已有先例。Sakana AI 近期与 NVIDIA 达成合作,将 Nemotron 纳入模型池选项。但指挥者本身的基座多样性一直是个空白,直到这次 Gemma 4 验证。
同一套训练方法,换一个基座,跑出同一组数字
验证的核心逻辑直截了当:取一个与 Qwen 不同谱系的开源模型 Gemma 4(Apache 2.0 许可),用完全相同的训练流程重训指挥者,看结果是否一致。
评测使用了 Sakana AI 自建的内部设问集,涵盖知识问答、代码修正、代码生成和研究生水平的科学问题。这些题目在训练和候选模型筛选阶段均未被使用,仅在最终测试时运行一次。指挥者的基座选用了 Gemma 4 E2B。
三个对比项的准确率分别为:随机调度基线 0.76,Gemma 4 版指挥者 0.91,既有 Fugu(Qwen 基座)0.92。成本方面,以随机调度为 1.00 的基准,Gemma 4 版与既有版本均为 0.68——降低了约三分之一的推理成本。
Sakana AI 未公开逐 benchmark 的细分数据,也未引入第三方评测。AI Weekly 在报道中提醒:「'性能相当'的结论是公司自述,并非独立对比。」但就一项内部架构验证而言,数据的清晰程度足以支撑其核心论点:训练方法是可迁移的。
当编排层不再绑定单一基座,企业就有了选择权
Fugu 发布时的公开信息集中在模型池的灵活性——用户可以自由配置池中模型、切换供应商。但指挥者层的基座依赖问题一直没有被正面回答。如果每次企业因为合规或主权要求而需要换基座时,都得重写编排逻辑,那「灵活」只是表面。
这次验证改写了这个前提。
Sakana AI 在博文中明确,接下来将基于「自社开发模型」(从预训练起就在日本国内构建的模型)训练指挥者,让客户在模型池中继续调用海外前沿模型的同时,编排层运行在可控的国产基座之上。这种「海外最强能力 + 国内主权编排」的双轨方案,是 Fugu 架构区别于单一模型 API 或简单路由层的关键。
StartupHub.ai 的数据显示,Sakana AI 在 2024 年融资 1900 万美元,评分 70/100,与 Adept AI(71/100)和 Mistral AI(69/100)处于同一竞争区间。对一家以在日本构建前沿 AI 为使命的公司而言,编排层的主权化不是一个技术炫技。它是打开日本企业市场的实际钥匙。
验证结束了,但 Sakana AI 真正的棋才刚开局
Gemma 4 版指挥者并没有比 Qwen 版更强。0.91 和 0.92 的差异在统计噪声范围内,成本数字完全一致。这正是 Sakana AI 想要的结果:不是超越,而是可替换。
当一家公司可以证明自己的核心训练方法不绑定任何单一基座,它就获得了一种战略弹性:根据客户所在地的监管、偏好和供应链,换一个大脑,但保持同样的表现。对于日本企业而言,这意味着可以在不将编排控制权交给海外模型的前提下,继续使用全球前沿 AI 能力。