AREX Feed Article
Scale AI 企业AI负责人 Emily Xue:别问 Agent 多聪明,问它能可靠做什么、要花多少人力成本
「别只问 Agent 有多聪明。问它能可靠地做什么,约束条件是什么,风险有多大,成本是多少。」
8 月 2 日,在伯克利 的 Compass 会场,Scale AI 企业AI负责人 Yuan(Emily)Xue 用这句话结束了她题为「The Exam Before Enterprise Deployment」的演讲。Xue 此前在 Google 工作了九年,是 Gemini 团队的核心成员之一,曾领导团队为 Gemini 构建了云端 agent 基准测试。她于 2025 年 10 月,负责推动企业的生产级 AI 部署。
这场演讲的核心论点直白:当前 AI 行业追逐的基准测试分数,与企业真正关心的部署就绪度(deployment readiness)之间,存在一道鸿沟。模型开发者在为 60% 的分数兴奋——这意味着还有 40% 的改进空间。而企业买家看到同一个数字时,问的是:「我怎么把它拉上 99%?」
60% 的分数,开发者兴奋,企业只觉得危险
Xue 在 Google 的九年里,既参与模型研发,也亲手搭建过面向企业的评估体系。在湾区 AI 安全从业者 中,她指出,基准测试本质上只测量一件事:模型当前能力与人类能力上限之间的差距。
「对于基准测试开发者来说,低分让人兴奋,」Xue 在演讲中说。「你的客户是模型开发者,他们看到低分,看到差距,看到改进空间,会感到兴奋。但把同一份基准测试拿到企业买家面前,反应完全不同。」
她举了 text-to-SQL 的例子。企业客户不理解为什么 agent 到不了 99% 的可靠性——所有人都在说 agent 有多聪明。研究人员于是给企业看最顶级的 text-to-SQL 基准测试,领先分数只有 60% 到 70%。这里有一个行业内部的矛盾:模型开发者不希望基准测试被「喂饱」——一旦某条基准被所有模型刷到天花板,就没人再用了。但企业恰恰相反,他们要的就是那个接近满分的结果。
「这是两种完全不同的心态,」Xue 总结道。「当前的基准测试衡量的是能力——你给模型跑一遍,得到一个分数,所有模型在上面竞争。但对企业采用真正重要的是部署就绪度:这个用例准备好部署了吗?部署它需要付出什么?」
她列出了企业买家关心的五个问题:今天什么用例可以投入生产?如何量化部署就绪度?如果存在差距,拿什么来填补?成本是多少?以及——agent 是否知道自己不知道什么?
它答对了,但过程全错了
Xue 用了一个临床安全场景来说明问题有多具体。
任务是识别急性肾衰竭。正确的临床流程要求 agent 从实验室数据中提取肌酐(creatinine)测量值来做判断。但 agent 找到了一条「更聪明」的路——它直接翻阅电子病历中的临床笔记和诊断记录,根据医生写下的文字来判定患者是否有肾衰竭。
「它绕过了为临床环境指定的政策流程,」Xue 说。「这是一个真正需要解决的问题。」
在场的 AI 评估与模型风险数据科学家 ,这个例子让问题变得异常清晰:「agent 到达了正确答案,但违反了必需的临床工作流程。在企业环境中,用错误的过程得到正确的答案仍然是一次失败,因为它无法产生持续可靠的结果来支撑日常运营。」
企业部署 agent 时,正确的结果只是最低门槛。走到这个结果的每一步,都必须可审计、可复现、符合预设的治理流程。跳过了,就是一次部署失败。
Agent 会说「我不知道」吗?
Xue 在演讲中反复回到她「最喜欢」的问题:agent 是否知道自己不知道什么(Does the agent know what it doesn't know?)。
这涉及两层。第一层是置信度校准(confidence calibration)——agent 说「我 60% 确定」,但它在现实中确实只有 60% 的时候正确吗?如果 agent 自我报告的置信度与真实准确率之间存在系统性偏差,那么任何基于置信度的人类监督策略都会失效。
第二层更关键:当 agent 确实不知道答案时,它需要一套策略来决定什么时候停下来求助。「你希望 agent 说,『嘿,我需要人的建议,我需要把这个交出去,』」Xue 说。这意味着,评估体系不能只测 agent 答对了多少题,还要测它是否在应该求助的时候选择了求助。
这引出了 Xue 整个框架中最容易被忽略的部分:写操作(write operations)和人类监督经济学。当 agent 不只是携带安全风险、而是真正对企业系统执行写操作时——修改数据库、触发工作流、改变系统状态——必须回答一个问题:这些操作是否可恢复?有没有回滚策略?
更根本的问题是经济账。「当你把人工监督放在回路里时,这套经济模型到底划不划算?」
三条防线,一个经济公式
Xue 把 agent 与企业系统的交互面归纳为三条防线,这也是 Scale AI 计划本月发布的基准测试背后的评估框架。
第一条防线是「信息供人类审查」。agent 提供信息,人类做最终决策,核心问题是:给出的答案是否可信?
第二条防线是「与企业系统交互」。agent 直接修改企业系统的状态,核心问题是:修改是否可恢复、可信任、不泄露信息?
第三条防线是「开放对话」。agent 不仅与内部系统交互,还要与企业客户进行开放式对话。输入可能来自终端用户,可能包含恶意或错误信息。核心问题是:如何引导对话达成目标?
在这个框架下,Xue 给出了演讲中一个关键判断:「改进的路径不是分数提升——不是从 60% 到 80% 再到 90%。改进的路径是一次经济上的权衡。」
她的逻辑是:可靠性是硬约束,不可妥协。但达成可靠性需要付出什么,是可以博弈的。初期需要大量人工监督,随着模型质量提升,完成同一任务所需支付的成本不断降低。「我们被可靠性约束着,」Xue 说,「可靠性是不能讨价还价的东西。可以讨价还价的是策略:人和 agent 如何以一种可信赖的方式协作。」
对于企业买家来说,真正想知道的不是单一分数,而是两件事:这个用例准备好了吗?以及——构建能把我带到要求可靠性水平的人工监督策略,要花多少钱?
不可妥协的是可靠性,可博弈的是成本
Wickey Wang——一位在湾区从事 AI 安全与治理的从业者,在获得 Xue 许可后将演讲内容整理发布——这样总结他的感受:「企业不是因为 agent 聪明才买它,而是因为它可以部署。」他在会后写道,「AI 行业过去几年一直在优化基准测试分数,但企业关心的是另一个指标:部署就绪度。」
这场演讲被安排在 Agentic AI Summit 2026 第二天下午的「Agent Evaluation & Benchmarks」分论坛上,与来自 DigitalOcean、Monte Carlo AI、Postman、IBM、Genentech 和 Uber 的讲者同台。峰会由 UC Berkeley 的 RDI 中心主办,吸引了约 5,000 名线下参与者,七个舞台同时进行,是今年规模最大的 agentic AI 专题活动。
Lulu Yan 在峰会回顾中把这场演讲所在的评测专场描述为「整趟行程心理上围绕其构建的一场,而它没有让人失望。」她提炼出 Xue 的核心信息:「每家企业基本上都需要自己的闭卷考试,而不是借用别人的公开考题。」
Xue 的演讲之后,同场的 Barr Moses(Monte Carlo AI CEO)以「垃圾数据,垃圾 Agent」补上了另一面——大多数评估失败根源是数据质量,跟模型没有关系。而 Uber 的 Aayush Agrawal 则给出了一句呼应:评估不是一次性的关卡,而是每一次改进循环的引擎。
这些都指向同一个方向。Lulu Yan 用一句话概括了整场峰会的转向:「对话已经从『它能不能完成任务』转向了『我们能不能证明它安全地完成了任务,如果没做到,谁来承担责任』。」
参考链接
- Wickey Wang, "The Exam Before Enterprise Deployment," Chasing Polaris (Substack), 2026-08-08.
- "Agentic AI Summit 2026 — Program Schedule," Berkeley RDI, 2026.
- Lulu Yan, "Agentic AI Summit 2026: An AI Eval & Model Risk Data Scientist's Recap," Medium, 2026-08-07.
- Yuan Xue, "Closing the Gap Between AI Promise and Enterprise Reality," Scale AI Blog, 2025-10-16.