AREX Feed Article
随 GPT-6 Astra 上线,OpenAI 为 Responses API 新增异步函数调用与推理中途转向
OpenAI 开发者团队成员 Nikunj Handa(其 X 个人简介首行即 @OpenAIDevs)于 UTC 时间 9 月 3 日 20:14(北京时间 9 月 4 日凌晨 4:14)发推宣布,随 GPT-6 Astra 一起发布的 Responses API 新增三项能力:异步函数调用(async function calling,工具运行期间模型可继续生成)、mid-turn steering(推理进行中向模型注入消息以改变方向),以及“调整推理力度不再破坏缓存”。末尾附上了一条 OpenAI 开发者文档的。
这三项不是个人口头预告。OpenAI API 的 9 月 3 日记录有两条:放出 GPT-6 Astra(支持 v1/responses 与 v1/chat/completions 两个端点),并把上述三项列入“面向 GPT-6 Astra 长时任务的新控制项”。
工具运行期间模型继续推理,入口是一个 async: true
此前 Responses API 的常规函数调用是阻塞式的:模型发出 function_call 后回合暂停,等应用把工具结果写回才能继续。新机制只需在工具定义上加一个 async: true 字段,调用项与输出项会带上对应标记。
的示例展示了差异:用户同时要求“查巴黎天气,并列出城市旅行三件必需品”,模型先发出 get_weather 调用,随即回答不依赖天气的“三件必需品”,应用在后台跑天气查询;结果就绪后,应用用原始 call_id 以 function_call_output 形式在后续请求中回填,模型再接着用。
边界写得很清楚。执行仍发生在应用侧,“异步工具不会把执行移交给 OpenAI,也不替你管理后台任务”,这与把整个响应生成放后台的 Background mode 是两回事。
async 只适用于 function 和 custom 两类由应用执行的工具,不适用于 OpenAI 托管的内置工具;文档还建议不要为 programmatic tool calling 配置异步工具,Multi-agent 模式下也不要把异步工具与并行工具调用混用。
对需要等结果才能继续的场景,文档给出“wait 工具”模式:应用自建一个同步的 wait_for_tasks 工具,模型用 task_handle 给每个后台任务编号,只在下一步确实依赖结果时才调用它等待。
推理中途插话:response.steer 的排队机制
mid-turn steering 解决的是另一个痛点:响应一旦开始,中途改需求只能等它跑完重来。新机制允许在响应运行期间,于同一 WebSocket 连接上发送 response.steer 事件,携带目标响应的 previous_response_id 和要注入的 input。
说明,API 会先回一个 response.steer.accepted,这“只代表输入已排队,不代表模型已经采纳”。随后服务器先完成当前输出项和已在运行的托管工具工作,再自动开启一条 continuation response 消化新指令;若转向打断了原响应,原响应以 response.incomplete 结束,原因标记为“steered”。
机制同样有限制:转向不会重写已经发给应用的输出、不会撤销已发生的动作、也不会取消已启动的工具。
如果原响应正在等应用返回工具结果或审批,转向会挂起(response.steer.pending 会列出 required_input),应用走完常规工具流程、按 call_id 回传结果后,服务器会把已接受的转向指令隐式插到输入最前面。Handa 特别点出,转向可注入的消息包括异步函数调用的工具输出,后台工具的结果到达后不必等整轮结束,就能把模型引向下一步。
为什么“调推理力度不破坏缓存”是省钱的更新
第三条在 changelog 里的完整表述是:可以在会话中途为困难任务提高推理力度、为常规追问降低力度,“同时保留缓存的 prompt 前缀”。成本含义要对照 的定价看:标准输入每百万 token 10 美元,缓存命中的输入只要 1 美元,差一个数量级。
此前在会话中途切换推理力度会让缓存的 prompt 前缀失效。Jay Dev 在中说明了分量:“真正安静的是第三条:过去切换推理力度会打爆 prompt 缓存,把任务中途的力度调节变得贵到没人做。把两者解耦,才让自适应力度在 harness 里变得可行,而不是 steering 本身。”
另一位转发者 Ilpo Leppänen 则在里反问:“为什么把它放在最后一条?这应该才是头条。”
只有 GPT-6 Astra 和更新的模型能用上
三项能力都绑定模型代际,旧模型拿不到。steering 指南写明仅 gpt-6-astra 经 WebSocket 支持,“GPT-5.6 及更早的模型不支持”;异步工具调用的兼容性说明是“GPT-6 Astra 及之后的模型”。社区在回复区反复追问的“老模型能不能用”,在文档层面已有答案。
GPT-6 Astra 本身也带来迁移注意点。同一 changelog 条目提示:Astra 不再支持 none 档推理力度(档位为 low、medium、high、xhigh、max),不支持自定义 temperature、top_p 与 logprobs,使用工具必须走 Responses API。模型页给出的规格是 105 万 token 上下文窗口、12.8 万 token 最大输出、知识截止 2026 年 4 月 30 日。
上线节奏上,Astra 当天先向 Trusted Access Program 中的企业开放;OpenAI 的称,未来几天内将覆盖全部 ChatGPT Plus、Pro、Business、Enterprise 用户,并经 OpenAI API 与 AWS 提供。
有人叫好,也有人问何时能用
截至本稿检索时(2026 年 9 月 4 日),Handa 这条推文已有约 19.7 万次浏览、1,428 个点赞、333 次收藏。转发与回复区对三条的读法并不相同。自称专注 agentic architecture 的开发者 Jens Honack 在中说,异步工具是 agent 循环里的大头:“每次慢速的浏览器、文件或数据库调用都不再是死等,而变成模型可以利用的时间。”
Decode 创始人、前 Descript AI 工程师 Francois Laberge 把落在来源上:“异步函数调用非常有意思。这是 GPT Live 模型的能力下放到常规模型?”Tracer Technologies 创始人 Daniel Priscu 则从账单角度转向功能:“中途转向不用为整个上下文再付一次钱,是这份清单里最安静、也是唯一改变账单的一项。”
Not Diamond 研究员 Alejandro Companioni 在中把缓存改动放进竞争语境:“力度变化不再使缓存失效。先是 Fable 5.1,现在是 Astra 和 Responses API。对动态模型使用来说是天大的消息。”
热度之下还有两个悬空问题。(Discourse 联合创始人兼联席 CEO,个人页自述)在中问:这些功能是否会进入 Codex 使用的后端端点?又能否作用到旧模型上?旧模型部分文档已经回答(steering 与异步工具都标注 Astra 起)。
Codex 端点是否同步支持,Doug Champion 在中猜测,前两项在 Codex 客户端里早就存在,“那是 harness 侧的功能,如今才下沉到端点本身”;本稿核对的 changelog 与三篇功能文档都没有涉及 Codex 端点。
另一个问题是“何时能用”。多位回复者追问“什么时候轮到我们试”,因为 GPT-6 Astra 目前只向 Trusted Access 项目中的企业开放。API 对名单之外开发者的开放时间,官方口径只有一句“未来几天”,没有具体日期。
参考链接
- _