AREX Feed Article
OpenAI 发布 Agents API 公开测试版,向所有开发者开放驱动 Codex 的 harness 与基础设施
OpenAI 于 9 月 10 日在宣布,Agents API 进入公开测试(public beta),向所有开发者开放。开发者用一次 API 调用指定任务、模型、工具与环境,就能创建一个 agent,运行在驱动 Codex 的同一套 harness 与基础设施上。
OpenAI 在公告里把 harness 描述为管理上下文、高效使用工具并协调 subagent 的一层机制。根据,这项服务让应用通过 OpenAI 托管的 API 访问 Codex harness:session、编排、上下文压缩与恢复由 OpenAI 管理,应用负责提供工具并选择执行环境。
一次调用,四样输入:任务、模型、工具与环境
创建 agent 的核心是一次 sessions.create 调用。公告给出的示例里,agent 字段定义模型和工具:挂上一个 MCP 服务器(示例中通过 HTTP 接入外部服务),并打开 multi_agent 开关;environment 指定运行环境;input 就是交给 agent 的任务:调查 service-api 在过去 30 分钟里升高的 5xx 错误率,把部署、错误与依赖分析分给并行 subagent,再将发现、证据和建议的缓解方案写入 /workspace/outputs。
官方文档把 Agents API 归纳为四个概念:Agent(模型、指令、工具与 MCP 服务器)、Environment(可选的沙箱或计算机)、Session(一个持久工作的 agent 实例)、Events 与 items(输入与产出)。一个托管 session 的典型流程是:创建 session,OpenAI 配置环境;发送任务开始工作;用流式输出或 webhook 跟进进度;之后可以继续给同一个 session 布置任务,或在 agent 工作时直接介入引导。文档说,agent 可以在沙箱里执行代码、编辑文件、连接 MCP 服务器并产出 artifacts;文档列出的完整示例覆盖事件响应、Slack bot、数据仓库分析、GitHub issue 调查与文档审查等场景。
自动压缩上下文、按需加载工具、并行拆分子任务
公告列出 harness 近期的几项改进。上下文压缩针对长会话:当 session 接近上下文上限,Agents API 自动压缩较早的上下文,保留 agent 继续工作所需的信息,让工作流跨多个上下文窗口运行,开发者不必自己实现压缩逻辑。
工具侧有两项机制。工具搜索(tool search)按需加载相关工具定义,以减少 token 用量与成本,同时保住模型缓存;程序化工具调用(programmatic tool calling)让 agent 并行发起调用、串联相关操作,在代码里过滤或合并结果,只把有用的部分带回上下文。工具类型上,Agents API 支持 MCP 服务器与自定义函数,也内置了 web search 等工具。
多 agent 支持把复杂任务拆成独立部分,交给并行工作的 subagent。每个 subagent 维护自己的上下文以保持专注,主 agent 负责协调并汇总结论。OpenAI 称,这可以加速研究、分析与编码任务,而且开发者不必自建编排层。
沙箱的三个选项:OpenAI 托管、自有基础设施、九个合作方
harness 由 OpenAI 运营,计算放在哪里则由开发者选择。Agents API 提供三种环境:OpenAI 托管的沙箱、开发者自己的基础设施,或合作方环境。
OpenAI 同时发布了 OpenAI hosted sandbox,它基于驱动 Codex 与 ChatGPT 的同一套沙箱基础设施。OpenAI 负责开通与管理,开发者可以用自己的文件、包、skills 与 plugins 配置这个环境,让 agent 运行代码、处理文件、产出 artifacts。
合作方包括 Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop 与 Vercel。公告说,这些集成覆盖完全托管的环境、部署在自己 VPC 内的方案、特定的文件与密钥存储方式,以及不同 CPU、GPU、内存配置下各异的性能、冷启动与成本特征。
费用方面,公告称使用 Agents API 没有额外费用,只为 agent 消耗的 token 和用到的工具付费。官方文档写得更细:模型按所选模型的 API 费率计费,OpenAI 工具按标准费率,OpenAI 托管沙箱按标准容器费率。
开源底座与版本化:harness 随模型一起升级
公告强调 Agents API 由开源的 Codex harness 驱动:OpenAI 负责运营和维护这套 harness,开发者可以查看其公开代码库,了解协调模型调用、工具与上下文的核心逻辑。
公告还把版本化访问列为一项重点。OpenAI 称,利用新模型能力通常意味着重写自己的 harness,很占用改进应用的精力;现在 harness 与模型一起维护、持续改进,每次模型发布,Agents API 都会提供相应的版本化能力。
公告开头交代了这套设计的来源:OpenAI 称,把 Codex 和 ChatGPT for Work 扩展到全球数百万用户的过程,让它认识到:要让长期运行的 agent 在实践中跑得好,需要两层支撑。一层是能管理上下文、高效使用工具、协调 subagent 的 harness,另一层是能让 agent 连续运行数天、处理文件、运行代码、保存中间结果的环境。
早期使用者:评估分从 0.71 到 0.85,失败响应减少 86%
公告引述了 8 家公司的反馈:Ciridae、Long Lake、WithCoverage、SafetyKit、Dwelly、Hypha、deepsense.ai 与 Nash.ai。以下数字均来自这些公司在公告中的表述。
Ciridae 的 CTO Jack Weissenberger 说,接入 Agents API 后,他们的评估分数从 0.71 升到 0.85,延迟降到了原来的四分之一。他还提到,此前在自己的架构里观察和编排 subagent 相当麻烦,团队为此优化了很久;新版 API 开箱即用的 subagent 流程带来了很大提升。
SafetyKit 技术团队成员 Bhavyansh Sabharwal 说,把案件审查工作流迁移到 Agents API 后,单案成本下降了 60%,延迟更低、token 效率明显改善,同时保持了原有表现。
Hypha 的首席工程师 Serhii Shchoholiev 说,把 agent harness 与沙箱分离后,agent 的失败响应减少了 86%。在金融服务里,赢得客户信任至关重要,这关系到客户是否敢把 agent 放进生产。
Nash.ai 联合创始人兼 CTO Aziz Alghunaim 说,公司在全球物流网络里部署了数千个长期运行的 agent,管理数亿次配送;他们需要的是持久 session 与编排层,让 agent 能跨小时甚至跨天推理、执行、恢复与协作。他称这些 agent 是“为合作伙伴运行关键物流任务的生产基础设施”。
公开测试的边界:数据驻留仅限美国、不支持 ZDR
官方文档列出了两项数据控制方面的现状:Agents API 的数据驻留目前只支持美国,且不支持 Zero Data Retention(ZDR,零数据保留);文档明确说明,选择自托管沙箱并不会让 Agents API 变得符合 ZDR 条件。文档还提到 session 会保留状态以支持跨轮继续工作,不需要时可以删除 session 与已发布的 artifacts。
OpenAI 把这轮开放称为公开测试,公告说会在测试期根据开发者反馈快速迭代,并朝 general availability(正式版本)推进。对需要在美国以外驻留数据、或必须在零数据保留条件下运行的团队来说,这两条限制目前仍然适用。