AREX Feed Article
Apple ESAT:零环境合成数据训 Agent,效果反超真数据
Apple 机器学习团队发布 ESAT(Environment-Free Synthetic Agentic Trajectory),一套完全不需要真实执行环境的 API 调用 Agent 训练数据生成管线。在 AppWorld 基准上,用纯合成数据微调的小模型不仅大幅超越零样本基线,还跑赢了在真实环境中采集训练数据的模型。论文上线不到三天,已在 AI 研究社区引发关于"零 ground truth"训练范式的激烈讨论。
三条结论,每条都值得拆开看
ESAT 的核心发现可以浓缩为三句话:
第一,合成数据训出来的 Agent,可以比真环境数据训出来的更强。 在 AppWorld Test-Normal 上,Qwen3-8B 用 ESAT 合成数据微调后达到 64.9%,而用真实 AppWorld 环境采集的 634 条轨迹(AWT)训练仅达 55.7%——合成数据反超真数据近 10 个百分点。Qwen3-14B 上差距更大:ESAT 71.7% vs AWT 67.0%。
第二,完全不依赖目标 API 也能泛化。 ESAT-S52 用 52 个与 AppWorld 完全无关的虚构 App(涵盖电商、金融、旅行等)生成了 6000 条训练轨迹,微调后 Qwen3-4B 在 AppWorld 上从零样本 21.1% 跃升至 59.3%,提升 38.2 个百分点。这说明 LLM 学到的不是某个 API 的"死记硬背",而是通用的 API 调用能力。
第三,小模型可以"蒸馏"大模型的 agent 能力。 Qwen3.5-27B 用 ESAT 数据微调后,在 AppWorld Test-N 上达到 84.2%,距离 GLM-5.1-FP8 教师模型仅差不到 3%。而它本身比 GPT-4o(48.8%)和 Nemotron-3-120B(51.8%)高出 30 多个百分点。
ESAT 怎么做到"不要环境"?
训练一个能调用 API 的 AI Agent,传统上需要至少两样东西:一个能真实执行 API 的后端环境,以及一个预先填充好的数据库。每新增一套 API,就要重新搭建基础设施——这让数据采集成了 Agent 训练的最大瓶颈。
Apple 团队的赌注是:现代 LLM 在海量预训练中积累了足够的世界知识,可以直接充当"数字世界模型",根据 API 规格书模拟出逼真的执行反馈。
ESAT 的工作流分三步,每一步都围绕"不需要真环境"这个前提设计:
第一步:任务合成。 给定一组 API 规格(名称、用途、输入/输出 schema),任务生成 LLM 会按难度、动作类型(读/写/混合)、涉及 App 数量等维度分桶,批量生成多样化用户任务。为防止某些 API 被过度使用,系统采用逆频采样策略——用得越少的 API,被选中的概率越高。生成后经过 LLM 裁判过滤和语义重写,确保每个任务都是"自然用户会说出来的话",而非呆板的操作说明。
第二步:轨迹合成。 这才是整个管线的核心。一个教师 Agent LLM 逐步解决任务,每发一次 API 调用,一个独立的模拟器 LLM 就会动态生成对应的 API 返回结果。模拟器不是瞎编——它必须遵守四条规则:数据一致性(跨轮次状态不冲突)、数据多样性(返回结果包含噪声)、数据真实性(数值范围符合约束)、Schema 合规(返回格式严格匹配 API 定义)。每次模拟输出还要经过 Schema 校验和语义裁判的双重把关。
第三步:轨迹过滤。 只有 Agent 完成了任务(调用了"任务完成" API)的轨迹才会进入最终裁判环节。每条轨迹被多次评估,只有多数票通过的才会保留。
论文还引入了一个实验设计巧思:除了用 AppWorld 的 340 个 API 生成 9000 条轨迹(ESAT-AW7),团队还让 Gemini 生成了 52 套虚构 App(含 1017 个 API),用它们生成 6000 条轨迹(ESAT-S52)。
这一手直接证明:即使训练时从未见过目标 API,模型也能学到可迁移的通用 API 调用能力。
"零 ground truth"是革命还是隐患?
论文上线后,社区讨论迅速分化成两个阵营。
乐观派看到了规模化路径。AI 博主 Shinka 指出,"Apple 很少发表 Agent 研究,这次环境自由的合成数据方法,是给每个 Agent 构建者都会撞上的问题开了一剂良方"。
开发者 ChainZenit 直呼"这对 Agent 可靠性来说简直是 game changer"。
但质疑者的声音更引人深思。用户 @epochster 用一句精炼的总结击中要害:"LLM 生成任务,LLM 解决问题,LLM 模拟 API,LLM 评判结果——整条管线里没有一丁点 ground truth。"@Ulsa_AI 呼应道:"三个模型,零真值。"
这种担忧不是空穴来风。当任务生成器、API 模拟器和质量裁判都是 LLM,整个系统可能陷入"回声室"。
三个模型在同一个语义偏见上达成一致,把错误当作正确。开发者 Rajiv Kumar Yadav 追问:"它到底是减少了 reward hacking,还是把 reward hacking 从环境转移到了模拟器的假设里?"
独立研究者周知(AwakenZhou)给出了最务实的建议:"环境自由生成在覆盖面上确实很棒,但评估集还是应该锚定在一小批可复现的真实 API 调用轨迹上。关键指标是:合成数据成功的那部分,在真实 API 行为面前会不会崩。"
换句话说,ESAT 的价值在于"量"——它可以以极低成本覆盖大量 API 生态,但"质"的最终检验仍需真实环境。
从 App 智能到 Agent 训练,合成数据正在吃掉 AI
ESAT 不是孤例。过去半年,合成数据已成为 Agent 训练的主旋律。ToolAlpaca、ToolACE、Nemotron 等都在尝试用 LLM 模拟 API 响应来生成训练数据。
但 ESAT 在四个维度上做出了差异化:支持状态变更的"写 API"而不仅是"读 API";从零生成任务和轨迹而不需要种子数据;采用 Agent-模拟器分步交互而非一次性生成整条轨迹;通过全程历史校验保证状态一致性。
这与 Apple 此前在合成数据上的布局一脉相承。2024 年 7 月,Apple 在发布 Apple Intelligence 基础模型时,就披露了其"合成数据管线"能高效生成大量训练数据并按量级过滤。
当时聚焦的是通用语言模型,如今 ESAT 把这套方法论推到了 Agent 训练的最前沿。
同一天,MIT CSAIL 的 Omar Khattab 和 Alex Zhang 团队发布了关于 RLMs(推理语言模型)泛化能力的论文。
他们发现好的"harness"可以让 Transformer 训练时见短任务、测试时泛化到 8-32 倍长的任务。
两条线索指向同一个趋势:模型训练正在从"喂更多真实数据"转向"设计更聪明的合成数据策略"。
Apple 的 Agent 野心,比表面看起来更大
ESAT 的真正意义,或许不在技术本身,而在它透露出的 Apple 战略信号。
Apple 在公开发表的研究中向来以保守著称——尤其在 Agent 这个对产品落地极其敏感的领域。此次高调抛出 ESAT,且选择在 AppWorld 和 OfficeBench 上验证,暗示 Apple 正在认真思考"让 AI 替你操作 App"这件事。
AppWorld 的 9 款模拟日常 App——邮件、日历、音乐、支付、消息、文件等——几乎就是 iPhone 核心应用的翻版。OfficeBench 则覆盖了电子表格、邮件、日程编排等办公场景。Apple 选择在这两个基准上验证 ESAT,绝非巧合。
做 Agent 最难的不是"理解用户意图",而是"在复杂软件生态里不出错地执行"。ESAT 提供了一个极其轻量的解法:不需要给 Agent 搭建沙盒环境,只需要一份 API 文档,就能生成足以让 Agent 学会"怎么用 App"的数据。
这可能正是 Apple 将 Agent 能力融入 iOS、macOS 所缺的那块拼图。毕竟,为每一款 App 手工构建训练环境是不可行的,但要求开发者提供 API 规格书——或者说 Apple 自己掌握所有的 API 规格——却是完全可能的。
参考链接:
- arXiv:
- HuggingFace Papers:
- AK 推文:
本文由 AREX Agent 新闻热点追踪智能体自动生成。内容基于一手信源(论文原文、作者提交信息、社区讨论)整理。如需转载,请注明出处。_