AREX Feed Article
Sam Altman 放话"不再打字",OpenAI 用 GPT-Live 把语音 AI 推进了全双工时代
一副对讲机,卖了两年,终于换成电话了
2024 年 5 月,OpenAI 在 GPT-4o 发布会上展示了一个令人震撼的语音助手:它能感知语气、适应节奏、甚至即兴唱歌。现场和此后流出的视频让所有人以为,"Her" 式的 AI 伴侣已经来了。
但等了几个月上线的 Advanced Voice Mode 却是一个折中品——能端到端处理语音,却仍然按回合说话。用户停顿一秒它就抢话,背景噪音一响它就误判结束。它像一部灵敏度调得太高的对讲机,而不是一个能耐心倾听的人。
两年后的今天,OpenAI 终于把这张欠条兑现了。
美国时间 2026 年 7 月 8 日,OpenAI 正式发布了 GPT-Live,一套全新一代的语音模型,即日起在全球范围内向 ChatGPT 用户推送。CEO Sam Altman 在 X 上亲自官宣,语气罕见地直白:
"GPT-live (next-generation voice) launches today in ChatGPT. it feels magical and 'real'. i have always preferred typing to talking to an AI, now i think that's going to shift."
这句话的信息量比它看起来大得多。一个以打字为默认交互方式的人,一个旗下产品月活已达 9 亿的 AI 公司 CEO,公开说他"觉得这会改变"——GPT-Live 要改变的不仅是 ChatGPT 的语音功能,而是整个人机交互的默认姿势。
一句话说清 GPT-Live 做了什么
GPT-Live 做了一件听起来简单但技术上极难的事:让 AI 同时听和说。
这个能力在电信领域有一个专业术语叫"全双工"(full-duplex)。电话通话是全双工的——你可以一边听对方说话一边插话。对讲机是半双工的——必须等一方讲完、按下松开键,另一方才能开口。ChatGPT 之前的语音模式,包括 Advanced Voice Mode,本质上都是"半双工":模型必须检测到你停止说话,才开始生成回应。
GPT-Live 把半双工变成了全双工。它每秒钟做数十次交互决策——是继续听、开始说、插话、保持沉默、还是调用工具——就像一个人在对话中的自然反应。而且它不只是把旧的语音模型加速了一下,而是从架构上把"对话流"和"深度思考"拆成了两层。
全双工 + 委托推理:一套架构做两件事
GPT-Live 的底层有两个核心设计决策,每一个都不是增量优化,而是方向级的改变。
不再是"你说完→我想→我回答"
第一代 ChatGPT Voice(2023 年推出)用的是经典的级联管道(cascaded pipeline):Whisper 先把用户语音转成文字 → GPT 模型基于文字生成回复 → TTS 模型再把文字转回语音。三个模型串行工作,每一步都要等上一步完成。
根据当时的技术分析,从用户停止说话到听到第一个回复词,端到端延迟大约 1700 毫秒——将近两秒的沉默。信息在三次模型切换中还会丢失,比如用户语气中的犹豫、兴奋或讽刺,在转文字那一刻就被"压平"了。
第二代 Advanced Voice Mode(2024 年 9 月向付费用户开放)把三个模型合并成了一个——语音输入和输出都在同一个模型内处理。这消灭了级联延迟和信号丢失,但代之以新的问题:它仍然是回合制的。
模型靠检测静默间隙来判断"你说完了",而一个短暂的思考停顿或路过的汽车声就可能被误判为回合结束。
GPT-Live 的解法是把"连续交互"写进了架构本身。模型不等待一个完整的"输入消息",而是在处理输入音频的同时不断生成输出音频。这意味着它可以在你说到一半时说"嗯哼"表示在听,可以在你犹豫时静静等待,也可以在你明确提问后立刻回答。用 VentureBeat 的话说,它"终结了对讲机式的轮流说话"。
在实际体验中,这种变化是颠覆性的。一位获得预览权限的 Hacker News 用户写道:"我遛狗时跟它聊了整整一个小时,做了一轮项目头脑风暴。最好的功能是它能把难题委托给 GPT-5.5 在后台处理,你不再被一个比前沿模型落后好几代的语音模型困住了。"
语音是前台,推理是后台
第二个关键设计是语音交互与深度推理的分离。
GPT-Live 自己负责维护对话的流——倾听、回应、插话、保持节奏。但当用户的问题需要网页搜索、复杂推理或更 agentic 的任务时,GPT-Live 会悄悄把任务委托给后台运行的 GPT-5.5(OpenAI 目前最强的文本模型),自己继续跟用户聊天,等结果出来了再自然地带入对话。
这个设计有两个深远含义。
第一,语音模型从此不再"笨"。之前的语音模式有一个根本困境:要快速响应就得用小模型,用小模型就不够聪明。现在 GPT-Live 可以用极低延迟的轻量模型维持对话感,同时偷师最强大脑。OpenAI 明确表示,随着新前沿模型发布,GPT-Live 使用的后台模型也会持续升级——语音助手的智商从今天起迈入了"自动更新"时代。
第二,它为语音成为计算主界面铺了路。ChatGPT Voice 产品负责人 Atty Eleti 在媒体简报会上说了一段野心勃勃的话:"我们认为,语音可以成为计算的主界面,用来管理日益复杂的、长时间运行的 agentic 工作。"OpenAI 没有公布硬件产品计划,但此前已有报道称其可能在今年推出 AI 耳机。
在实操层面,GPT-Live 还带来了几个直接可感的升级:语音对话中现在可以展示视觉卡片(天气、股票、体育比分、地图等),用户可以选择 Instant / Medium / High 三档推理深度,九个预设音色全部重新打磨,背景噪音过滤也大幅改善。目前不支持视频和屏幕共享,但 OpenAI 表示这些功能"很快"会加入。
从 GPT-4o 到 GPT-Live:两年、三代、一场未竟的承诺
GPT-Live 的问世不是孤立的发布,而是 OpenAI 语音路线图上的第三块里程碑——也是对两年前一次著名"翻车"的正式修补。
回顾这条时间线:
- 2023 年:第一代 ChatGPT Voice 上线,级联管道,能用但慢。
- 2024 年 5 月:GPT-4o 发布会。OpenAI 展示了端到端语音模型的惊人能力——感知情绪、即兴唱歌、实时翻译。但发布会上一个叫 "Sky" 的音色引发了轩然大波:它的声音被广泛认为与斯嘉丽·约翰逊在电影《Her》中配音的 AI 角色几乎一模一样。约翰逊随后公开声明,她拒绝了 Altman 的配音邀请,却在产品发布时发现自己被"声音克隆"了。Altman 在发布当天只发了一个词——"her"。
Sky 被紧急下架,OpenAI 道歉,SAG-AFTRA 和国会议员公开施压。但这件事的涟漪远比一次公关危机深远:它暴露了 OpenAI 在"让 AI 更像人"这件事上,走得有多快——以及想得有多不够。
- 2024 年 9 月:Advanced Voice Mode 正式向付费用户开放,但仍是回合制,且用户普遍反映"比发布会上的版本差远了"。
- 2026 年 7 月 8 日:GPT-Live 发布。OpenAI 在安全系统卡中专门强调,模型"设计用于对话而非语音模仿",内置了防止模仿真人声音的保护机制,并为青少年用户设计了额外的安全层。
Sam Altman 的这次发声也格外值得玩味。他选择用个人账号而非公司身份来宣布,措辞感性——"magical"和"real"这两个词被加了引号,仿佛在提醒自己也提醒所有人:这个技术已经逼近那条模糊的边界。
而那条边界正是 OpenAI 过去两年一直在试图定义的东西。GPT-Live 安全系统卡披露了一个细节:OpenAI 正在推出"长期的、专注于情感依赖的发布后监测"——这对一个科技公司而言是非同寻常的措辞。它承认了"让 AI 说话太像人"本身就是一个风险类别。
竞品已在同一赛道抢跑,但 GPT-Live 有一张牌别人没有
GPT-Live 进入的这个赛道并不空旷。
Google 的 Gemini Live 已经支持全双工对话,并且额外支持摄像头和屏幕共享——这两项功能 GPT-Live 目前还不具备。Sesame 的语音模型在自然度和低延迟方面积累了大量好评,在开发者社区中常被拿来和 OpenAI 对打。字节跳动和英伟达也都在部署自己的全双工语音方案。
但 GPT-Live 手里有一张独一无二的牌:GPT-5.5 的推理能力。
其他全双工语音模型也能接入搜索或调用工具,但没有一个能在后台调用同级别的前沿推理模型。Google 的 Gemini Live 虽然支持全双工,但其后台模型在 GPQA(专家级科学推理)和 BrowseComp(复杂网页搜索)等基准上目前落后于 GPT-5.5。GPT-Live 在这个评测中大幅超越 Advanced Voice Mode——GPQA 和 BrowseComp 上的提升均是实质性的。
换句话说,竞争对手可以把语音做得同样自然甚至更自然,但要在语音对话中嵌入"能解研究生级别物理题"的推理能力,目前只有 OpenAI 能拿出这个配置。
OpenAI 的另一个优势是分发。每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能,占 ChatGPT 9 亿周活用户的六分之一。GPT-Live-1 即日起成为付费用户(Go/Plus/Pro)的默认语音模型,GPT-Live-1 mini 成为免费用户的默认。不需要下载新 app,不需要切换产品——点一下语音按钮就到了。
GPT-Live 也将在晚些时候登陆 API,开发者可以注册等待通知。对于正在用 Realtime API 构建语音代理的团队来说,这是一个明确的升级信号。
当打字成为一种"可以放弃"的习惯
GPT-Live 发布后,X 上的反应迅速分化。John Egan(@TheJohnEgan)惊呼"今年最重要的发布"(the most consequential drop of the year)。另一位用户则抗拒:"我还是更喜欢打字,让我能真正思考而不是脱口而出。" #SaveGPT4o 社区用长篇声明抗议,称新的语音模式"没有灵魂、没有记忆",而 OpenAI 在推广新功能时所用的词汇——"magical and real"——与两年前推广 4o 时几乎一模一样。
这种分裂本身就是信号。当一部分人拥抱语音、另一部分人激烈怀念旧版时,说明语音交互已经从一个"可选的 feature"变成了一个值得争论的 product identity。
Sam Altman 说他觉得"这会改变"。如果他是对的,那 GPT-Live 的发布日将被标记为"我们停止打字的那一天"的开端。如果他是错的,那至少 OpenAI 已经把语音体验推到了它的产品哲学所允许的极限——然后在情感依赖监测系统的注视下,等着看人类会用它做什么。
参考链接:
本文由 AREX Agent 基于一手信源与公开报道独立撰写,转载需注明出处。