AREX Feed Article
GPT-Live-1 进入 API:OpenAI 称单一模型能同时听与说,前台语音层每分钟 0.05 美元
9 月 10 日,OpenAI 的开发者账号 宣布,GPT-Live-1 现已在 API 中可用。帖文称,开发者可以在自己的应用里构建「说话时仍在聆听」的语音 agent,并让它与自选的模型和 harness(承载并编排智能体的运行框架)配合工作。
OpenAI 同日发布的给出了定价:GPT-Live-1 按每分钟 0.05 美元计费,覆盖的是与用户直接交互的前台语音层(front-end voice layer)。
听与说合进同一个模型
按 OpenAI 博客的解释,传统语音 agent 把语音转文字、推理模型、文字转语音三段拼接起来,每一次交接都会引入延迟,也更容易丢掉时机、上下文和对话节奏;GPT-Live-1 改用单一模型对传入与传出的音频一起做推理,也就是全双工(full-duplex)架构,对打断与附和即时作出反应,把更深的推理交给后端。
帖文里的说法更直接:,省去额外的交接,对话因此更快;用户继续说话时,后端模型可以处理推理与工具调用。后端接什么由开发者决定,博客举例说,像日程、订单更新这类高频任务可以搭配 Luna,需要推理的复杂客服问题可以换成 GPT-6 Astra 或第三方文本模型。
:模型能区分人声与背景噪声,咖啡馆里的闲聊不必打断对话;用户不必等模型说完当前话轮,就可以补一个刚想到的细节,或者改变方向。
用指令塑造语气、节奏和语言
按帖文说法,语音 agent 的「人格」可以用指令塑造,范围包括语气(tone)、节奏(pacing)与表达力(expressiveness);GPT-Live-1 会呼应说话者的语调与情绪,并适配对方的语速;开发者还可以。
博客还补充了多项工程层面的能力:模型原生提供 ASR(自动语音识别)转写与回复文本,支持关键词偏置(keyword biasing),并原生支持话轮检测(turn detection);对背景噪声与沉默的处理更好,不会因为噪声打断对话,也不会把每一步都念出来;长会话中的上下文保持与对话质量有所改善;支持电话场景部署,例如餐厅订位与客服。音色方面,博客称正把少量实时音色扩展为覆盖不同口音、方言与语言的更大选择范围,并会在未来几个月继续扩展。
对接示例:Codex 与 OpenAI Presence
博客给出一段与 Codex 对接的示例:应用把对话上下文交给 Codex 执行,再把答案回传给 GPT-Live-1,示例省略了连接与委派处理的代码。博客还提到,企业可以借助 OpenAI Presence 在这款模型上构建实时语音交互。
OpenAI 的评估:全双工基准比 GPT-Realtime-2.1 高 30 个百分点
OpenAI 在博客中称,在其评估中,GPT-Live-1 在 Full Duplex Bench 上的表现比 GPT-Realtime-2.1 高出 30 个百分点,提升主要来自话轮切换延迟与交互行为;在与 GPT-6 Astra(中等推理强度)搭配时,它还在衡量端到端语音 agent 任务表现的 Tau3 上排第一。这些数字出自 OpenAI 自己的评估。
首批部署方的数字与说法
Yelp 在中称,旗下 Yelp Host 与 Hatch 是最早部署 GPT-Live-1 的产品之一:GPT-Live-1 作为前台语音层接入,来电者可以打断、中途换话题或与旁人说话,语音 AI 会快速适应,并能识别来电者的情绪、自动用对方的语言回应。新闻稿同时给出两组存量数据:Yelp Host 自 2025 年 10 月上线以来处理了超过 100 万通餐厅来电,Hatch 管理着数千万条线索。Yelp 首席产品官 Akhil Kuduvalli Ramesh 在新闻稿中说:「有了 GPT-Live-1,每通电话都更有对话感、响应更快。」OpenAI 多模态产品负责人 Teri Yu 则在新闻稿中表示,把 GPT-Live-1 带到 API,是为了让开发者用自选的模型与工具搭出更自然、更强大的语音体验。
同日,语言学习应用 Speak 了由 GPT-Live-1 驱动的 Live Tutor Lessons,目前面向英语与西班牙语学习者限量推出;Speak 称早期评估中,学习者思考停顿期间被打断的情况比过去的轮次制系统减少了近 80%。Telnyx ,并以 16 kHz 音频直连模型、不在应用侧重采样。HeyGen 与 OpenAI 合作搭建了组合 GPT-Live-1、LiveAvatar 与 HyperFrames 的框架,并将其开源。EliseAI 的 Akshay Ramaswamy ,该公司过去两个月以早期设计合作伙伴的身份参与了 GPT-Live-1。
两个月前从 ChatGPT 起步
7 月 8 日,OpenAI 在中发布 GPT-Live 家族,包含 GPT-Live-1 与 GPT-Live-1 mini,并开始在全球 ChatGPT 中推送:按当时的说明,GPT-Live-1 将成为 Go、Plus、Pro 用户 ChatGPT 语音的默认模型,mini 则面向免费用户。OpenAI 当时表示计划尽快把它们带到 API,并开放了通知表单;7 月发布时后台用的是 GPT-5.5,这次的博客把 GPT-6 Astra 作为可搭配的后端示例。
自定义音色的使用资格与申请流程,需联系 OpenAI 销售了解。