AREX Feed Article
NVIDIA 放话:AI agent 不需要一个超级模型,Cursor 和 Glean 已经用数据投了票
8 月 4 日,NVIDIA 在 LinkedIn 和 X 平台同步发布了一篇名为《Why Enterprise AI Needs a System of Models》的长文,核心论点只有一句话:企业级 AI agent 不应该靠一个模型包打天下,而应该像一个团队那样运转——规划、检索、工具调用、推理、验证,每个环节交给最擅长那个环节的模型。
文章配了两个关键案例:Cursor 通过混合模型方案将单次 AI 任务的成本降低了 15 倍;Glean 基于 NVIDIA Nemotron 3 Nano 构建的路由模型 Waldo,在保持准确率不变的前提下,把延迟砍掉一半、token 消耗减少四分之一。
这篇文章是一份架构方向声明。Cursor 和 Glean 的工程团队用生产数据替它站了台。
两个数字撑起的架构主张
文章的论证骨架很清晰,层层递进。
第一层是类比。NVIDIA 开篇就打了个比方:没有哪家公司会让一个员工同时负责项目规划、代码编写、代码审查、工具操作和结果验证。复杂工作的前提是专业化分工。AI agent 同理。
第二层是路由。不同的任务对模型的要求完全不同:有的需要广域推理,有的需要快速检索,有的需要精确的代码分析,有的需要可靠的工具调用,有的需要独立验证。NVIDIA 把智能路由定义为"将每一项任务分配给最适合的模型",同时考虑能力、延迟、数据驻留、算力成本和监管约束。换句话说,路由层决定了 agent 的效率上限。
第三层是案例。Cursor 的结论是:选对模型组合,可以将解决一项 AI 任务的成本降低 15 倍。这个数字没有附带具体的 benchmark 名称和工作负载描述,NVIDIA 的写法是"found that choosing the right mix of models can reduce the cost of solving an AI task by 15X"——用了"can"而非精确测试陈述,但 15 倍这个量级本身就足以说明问题。
Glean 的 Waldo 则展示了路由模型在真实产品中的落地形态。Waldo 是一个在 NVIDIA Nemotron 3 Nano 上定制微调的路由模型:当用户发出查询,Waldo 先用 Glean 的搜索工具完成上下文收集,然后判断该将问题交给哪个模型做深度推理,最后把上下文一并交过去。Glean 的应用 AI 负责人 verrsane 在引用推文中补充了量化数据:延迟降低约 50%,token 用量减少约 25%。
第四层是知识沉淀。NVIDIA 指出,系统化多模型架构的真正价值不只是效率,还在于企业可以将本领域的专业知识嵌入 agent 行为中。随着团队持续优化 workflow、模型行为和路由策略,agent 会越来越一致地运用公司知识,并通过反馈不断改进。
NVIDIA 三条核心主张
整篇文章可以提炼为三个论点,每个都有明确的工程含义。
主张一:AI agent 的未来是"团队"而非"超人"。文章明确反对单一通用模型接管所有工作的思路。规划、搜索、工具调用、代码审查、结果验证应该由不同模型承担,而且可以并行执行。对用户来说,体验仍然像一个统一的智能系统;但在系统层面,是一组模型在协作。
主张二:路由层正在成为 agent 架构的必选项。智能路由不仅要决定"用哪个模型",还要决定"在哪里跑":有些任务需要留在本地,有些需要跑在企业基础设施上,有些需要云端规模。NVIDIA 的潜台词很清楚:它的 Nemotron 模型线、NIM 微服务、DGX Cloud 和 AI Enterprise 软件栈,正是为这个多模型、多环境的架构设计的。
主张三:专业化让企业知识可嵌入、可复用。NVIDIA 把"公司知识"看作 agent 的核心资产,而多模型架构是让这些知识被系统化运用的前提。Waldo 不是一个通用的搜索模型,它是 Glean 把自己的企业搜索逻辑灌进 Nemotron、再用 RL 训练出来的路由专家。这条路一旦走通,每个垂直领域都可以复制。
谁在给 NVIDIA 的叙事站台
Jonathan Braude,Cursor 的 GTM(go-to-market)创始团队成员,在引用推文中写道:"Solid article following the work my team and I have been doing with the good people at NVIDIA. Feels good to be ideologically aligned with the folks building the foundation of our technology."(一篇扎实的文章,呼应了我和团队一直在跟 NVIDIA 合作推进的工作。与技术基础设施的建设者在理念上保持一致,感觉很好。)
Glean 官方账号则更为直接:"Open ecosystem of models 🤝 enterprise-ready AI. Proud to build Waldo, our agentic search model, on NVIDIA Nemotron 3 Nano."(开放的模型生态配合企业级 AI。很自豪能在 NVIDIA Nemotron 3 Nano 上构建我们的 agentic 搜索模型 Waldo。)随后又在 NVIDIA 推文下跟评了一句:"Enterprise AI needs an open model ecosystem 💯。"(企业 AI 需要一个开放的模型生态。)
Glean 的应用 AI 负责人 verrsane 透露了更多工程细节:Waldo 的核心能力是上下文收集和模型选择,团队用 RL 对 Nemotron 做了深度微调:"we RL'ed tf out of NVIDIA's Nemotron for our context / routing model"。
Synapse Brief 在一篇长篇分析中指出, NVIDIA 的整个企业 AI 文档体系已经不再以"模型好不好"为评估维度,而是按阶段拆分指标:首 token 时间、token 速率、组件延迟、任务完成率、忠实度、故障率、超时率。这"不是 chatbot 的指标清单,而是一个系统的指标清单"。分析进一步指出,一旦企业能够按阶段独立测量,单模型方案就不再是"更简单"的选择,反而意味着"你根本不知道哪个环节在吃掉你的预算"。
社区中也有谨慎的声音。Stats Wire 认为多模型路由的架构逻辑站得住脚,但"任何附着于这一主张的具体倍速数字,在绑定到某个公开 benchmark 和 workload 之前,都应该被视为未经核实"。
单一模型叙事正在瓦解,但路线之争才刚刚开始
NVIDIA 的这篇文章选择了一个精准的时机。就在同一天,NVIDIA 还发布了另一篇博文,宣布由 120 多家组织组成的 Open Secure AI Alliance 正在制定 SAFE 指南。那篇文章里有一句话与 LinkedIn 文章形成了互文:"AI agents are more than a model — they tap into systems of open and closed models, harnesses, tools and runtimes to get work done."
两篇文章指向同一个判断:AI agent 的默认假设正在从"选最好的模型"转向"设计最好的模型体系"。NVIDIA 在赌这件事成为行业共识,因为一旦多模型架构成为企业 AI 的标准范式,对推理基础设施、模型路由、安全工具链的需求就会爆炸式增长。NVIDIA 正在为每一层准备产品。
但路线之争远未结束。OpenAI、Anthropic 和 Google 仍然在走"一个超强模型解决一切"的路线,不断用更大的上下文窗口、更强的推理能力和更统一的 agent 框架来压缩中间件的生存空间。两种路径各有代价:多模型方案需要更复杂的编排、更高的工程投入和更严密的可观测性;单模型方案则面临边际收益递减和成本控制难题。
Cursor 和 Glean 的案例说明多模型路线在特定场景下已经跑通了生产闭环。但这两个案例的共同点是:它们背后的团队本身就具备顶尖的 AI 工程能力,能够对模型进行深度定制和 RL 训练。对大多数企业来说,"一个模型团队"的组织成本,可能比"一个模型"的算力成本更难消化。
把这篇 LinkedIn 文章当成中立技术综述来读,就错过了重点。NVIDIA 在邀请整个行业做一道选择题:继续找一个万能模型,还是开始组建一个模型团队?
参考链接: