AREX Feed Article
Sakana AI 发布 Fugu Max 与 Fugu Ultra v2,称 Ultra v2 的 Chartography 得分 48.3 高于 Opus 5 与 Fable 5
9 月 11 日,日本 AI 公司 Sakana AI 通过发布 Fugu Max 与 Fugu Ultra v2,称这是其多智能体编排系统 Sakana Fugu 的下一代版本。公告发布于 UTC 02:15(北京时间 10:15);与同日更新。Sakana AI 称,两款产品当天起即可通过标准 OpenAI 兼容 API 调用,已经在使用 Fugu 的用户只需改一行参数,不必迁移。
按 Sakana AI 公布的数字,Fugu Ultra v2 在测试视觉推理与数据解读的 Chartography 上得 48.3 分,高于 Opus 5 的 27.3 分与 Fable 5 的 29.5 分;在面向真实软件工程的 DeepSWE 上得 74.3 分,公司称这一成绩超过了每 token 成本是它的 3~5 倍的模型。同一批材料称,Fugu Max 用低 2~6 倍的成本,达到与精英模型「相距不远」的性能。这些基准分数,以及本文其余所有成绩,都出自 Sakana AI 自己的发布材料。
同一套编排架构,朝两个方向调优
Sakana AI 在博客里强调,Fugu Max 与 Fugu Ultra v2 共用同一套核心编排架构,只是针对两种任务目标分别调优:Fugu Max 回答的是「在尽可能低的成本下能给出多好的输出」,Fugu Ultra v2 回答的是「复杂多步任务上能达到多高的能力」。
博客称,Fugu Max 的池子是「迄今最大的开放权重与专用模型池」,其中点名了 NVIDIA Nemotron 系列,这条线来自 8 月公布的 NVIDIA 合作;任务会被动态路由给池子里能解决它的最精简模型。Fugu Ultra v2 的目标则是把复杂任务上的能力推得更高。
产品页对机制的描述是:Fugu 不用人工规定智能体团队的组织、角色或流程,而是自己学着从池子里编组智能体,并找到未必直观但高效的协作方式。页面把技术基础落在两篇 ICLR 2026 论文上:TRINITY 用一个轻量进化协调器在多轮中给模型分配 Thinker、Worker、Verifier 三种角色;Conductor 用强化学习让系统自行发现自然语言协调策略。
Ultra v2 的成绩单,和它不进池子的三个模型
博客用八项基准给 Ultra v2 排位置:五项取得最佳或并列最佳,分别是 GDP.pdf、Chartography、SWEFish、DeepSWE 与 Toolathon;八项中有七项进入前两名。当天稍晚,官方账号又发了,重申八项基准中五项排名第一,并再次点出 Chartography 与 DeepSWE 两项。
另一条被反复强调的信息是模型池名单:Fugu Ultra v2 的智能体池里不含 Fable 5、Fable 5.1 与 GPT-6-Astra,发布材料标注的训练数据截止日为 2026 年 8 月 28 日。Sakana AI 由此得出的结论是,它不需要依靠这些封闭前沿模型就能给出前沿水平的输出。
五项「最佳」里有一项出自 Sakana 自己的基准:SWEFish 在博客中被描述为「反映 Sakana AI 自身编码挑战与用例的内部基准」。
Fugu Max 的 $2 / $6 与 40%~60% 成本主张
Fugu Max 的价格是每百万输入 token $2、每百万输出 token $6。博客称,按这组费率,它的输出价格比 Sonnet 5、GPT 5.6 Terra 和 Kimi K3 低 40%~60%;它在 Terminal Bench 2.1、GPQA-D、AA-LCR、GDP.pdf、AutomationBench 与 SWEFish 六项基准上取得最佳总分,并在十项基准中的七项上把成本-性能帕累托前沿向外推。博客为 Fugu Max 给出的结果图是散点图:纵轴为基准得分,横轴为每百万输出 token 的价格。
Ultra v2 的费率由日本 ITmedia 在同日报道中:每百万 token 输入 $5、输出 $30、缓存输入 $0.50;同一报道称 Fugu Max 的缓存输入价为 $0.25。Sakana 产品页对 Fugu Ultra 列出的常规费率与 ITmedia 的报道一致,并注明上下文超过 272K token 时升至输入 $10、输出 $45、缓存输入 $1.00。
「模型韧性」:Sakana 给出的理由
公告把理由放在模型韧性上:系统靠可替换的开放与专用模型池交付前沿输出,不依赖单个前沿模型,规避 vendor lock-in(供应商锁定)、API 撤销与突然的服务中断。
Sakana AI 联合创始人兼 CEO @hardmaru 在同日上午的里把话说得更直接:依赖单一公司的模型做关键基础设施是巨大风险,「最近的出口管制已经显示,访问权可能一夜之间消失」;编排系统靠一个完全可替换的智能体池绕开供应商限制。他在同一帖里称这是「AI 主权」所需要的基础设施。
同一条理由在发布前两周就出现过。8 月 29 日,他就某款热门编程工具失去前沿模型访问权,这正说明模型韧性的重要:在他看来,未来产品会在若干底层模型下线时继续正常工作,绕过去就行。
博客给出的时间线是:4 月测试版(beta),6 月正式商用并发布 Fugu Ultra v1,7 月 Fugu-Cyber 与 Claude Code 接口,8 月 Sakana Chat 与 NVIDIA 合作,9 月即本次发布。池子的可替换性对用户有边界:产品页 FAQ 说明,Fugu Ultra 依赖完整智能体池来发挥性能,因此池子是固定的;基础版 Fugu 可以在控制台里排除特定模型。
NVIDIA 的表态、日本媒体的报道,与名单上待答的问题
NVIDIA 方面在同一天作了回应。NVIDIA Japan 的 X 账号称,;NVIDIA AI 的官方账号在 Sakana 的公告下。
日本 ITmedia AI+ 在当天下午报道了这次发布,标题一方面写 Fugu 新版本「宣称部分超过 GPT-6 Astra 与 Fable 5.1」,另一方面注明这两款模型不在其对接之列。
产品页另注明,Sakana Fugu 目前不在 EU/EEA 提供,公司正在推进对 GDPR 及当地法规的合规。
公告回复区里,@jatingargiitk 指向 Ultra v2 的模型池:排除说明只点名了三个模型,Opus 5 与 Sonnet 5 是否也在池子里。