AREX Feed Article
150M 用户语音一夜换芯,OpenAI 用 GPT-Live-1 截胡苹果亚马逊
TL;DR: OpenAI 在 GPT-5.6 全面上线前夜发布 GPT-Live-1 和 GPT-Live-1 mini,用全双工架构替换了 ChatGPT 的 Advanced Voice Mode,实现"边听边说"的自然对话。模型将语音交互层与推理层解耦,复杂问题交给后台 GPT-5.5 处理。全球 iOS、Android、Web 同步推送,API 即将开放。但首批用户的反应两极分化:有人直呼"魔法般真实",有人吐槽"AI 插嘴更烦人了"。
GPT-5.6 上线前夜,OpenAI 先换掉了 1.5 亿人的耳朵
北京时间 7 月 9 日凌晨,就在 GPT-5.6 Sol 全面开放的同一天,OpenAI 悄然完成了一次可能比新模型本身更深远的产品手术——ChatGPT 的语音交互底层被整个换掉了。
全新的 GPT-Live-1 和 GPT-Live-1 mini 从这一刻起,成为 ChatGPT 语音的默认引擎。付费用户(Go、Plus、Pro)自动获得 GPT-Live-1,免费用户获得 mini 版本。iOS、Android、网页端同步推送。
这不是一次普通的模型升级。OpenAI 用了"全双工"(full-duplex)这个词——在通信领域,全双工意味着通话双方可以同时说和听。应用到 AI 语音,意味着 ChatGPT 不再需要等你把话说完才开口,它可以一边听你讲、一边做出反应。
OpenAI 官方公告在 X 平台 12 小时内收获超过 500 万次浏览、2.1 万点赞和 1900 次转发。CEO Sam Altman 亲自下场:"我一直更喜欢打字而不是跟 AI 说话,现在我觉得这要变了。"
Sam Altman 说"打字时代要变了",用户回了一句"别插嘴"
Sam Altman 在 GPT-Live 发布后不久发帖称新模型"感觉像魔法一样真实",这条推文获得了 59 万次浏览和超过 1 万点赞。OpenAI 员工、X 平台 AI 圈知名 KOL Jason(@jxnlco,OpenAI 团队成员)随即抛出一个病毒式 prompt:"每次我打断你,你就越来越生气,让我闭嘴让我说完"——这条推文收获了 1360 个赞和近千次收藏,评论区被"这感觉太奇妙了"刷屏。
但另一边的声音同样响亮。拥有 150 万粉丝的 X 大号 Autism Capital 直接怼道:"它明明一直在打断那位女士说话,笑死"——532 个赞。Notion 产品负责人 Brian Lovin(11.8 万粉丝)也评论:"电脑明明一直在插嘴……"Web3 领域知名人物、Yuga Labs 副总裁 Quit(10 万粉丝)的吐槽更尖锐:"我最大的问题就是它连我停顿一秒都要打断。所以你们现在是升级成打断得更多了?"
一线用户的反馈也出现了明显分化。一位获得 1 万点赞的日本用户 @Rabbuttz_VR 发布了 1.2 倍速实测视频,称"说话时的违和感几乎完全消失了"。而拥有 27.7 万粉丝的 AI 生产力博主 Alex Prompter 则给出了实用的工作流建议:"你一分钟打字 40 个词,说话 150 个。GPT-Live 让说话成了默认选项。"他分享了自己的新用法:散步时对着 ChatGPT 做 10 分钟"语音倾倒"(voice dump),产出约 1500 词,再让它整理成简报。
还有一股来自 GPT-4o 老用户的怀旧声浪——#keep4o 标签在评论区反复出现,多位用户表达了对旧版语音模式"更有温度"的怀念。一位叫 Corrine 的用户写道:"一段愉快的对话,不是靠 AI 说几个'mm-hmm''uh-huh'就能堆出来的。"
从 1.7 秒延迟到全双工:ChatGPT 语音的三年三级跳
GPT-Live 是 ChatGPT 语音技术的第三代产品,每一代之间恰好间隔大约一年。
第一代(2023 年):级联流水线。Whisper 做语音转文字 → GPT-4 生成文本回复 → TTS 转回语音。三个模型串行工作,每次交接都有信息损耗。据 OpenHelm 在 2024 年 10 月的分析,这套管线累积延迟高达约 1700 毫秒——用户说完话要等将近两秒才能听到第一个字。
第二代(2024 年 7-9 月):Advanced Voice Mode。将三个模型压缩为一个原生处理音频的端到端模型,延迟大幅降低,对话更流畅。但本质上仍然是"轮流发言":模型必须等你停下、检测到静默之后才能开口。OpenAI 在 GPT-Live 公告中坦承:"即使是短暂的停顿或背景噪音,也可能被误判为你已经说完了——导致模型在不该开口的时候打断你。"
第三代就是此刻的 GPT-Live。持续输入 + 持续输出,每秒多次判断"该说、继续听、暂停、打断还是调工具"。更重要的是,语音层被彻底解耦了。
为什么选在 7 月 8 日?前一天的日历上写着:6 月 26 日 GPT-5.6 Sol 预览发布,7 月 9 日全面开放。6 月 8 日 Apple WWDC 上 Siri AI 刚刚亮相——更会聊天、能跨应用执行任务、有专属 App。Amazon 的 Alexa+ 也在今年年初开始推送。语音 AI 的牌桌正在迅速坐满,OpenAI 选择在大模型升级的同时换掉语音引擎,一箭双雕。
真正的杀招不是全双工,是把"嘴"和"脑"拆开了
GPT-Live 有两个架构层面的创新,但真正可能改变竞争格局的是第二个。
第一个创新:全双工连续交互。 模型不再处理"一条消息接一条消息"的序列,而是持续处理音频输入的同时生成输出。每秒做出多次交互决策——开口、继续听、停顿、打断、调用工具。结果是:AI 可以在你说话时说"嗯哼""对""懂了",可以捕捉自然停顿而不急着插话,可以处理快速打断而不让整段对话崩掉。OpenAI 还展示了实时翻译能力(虽然演示中 Hindi 翻译带有浓重美式口音)。
第二个创新:语音层与推理层解耦。 这是更底层的架构赌注。GPT-Live 本身是一个专为实时语音交互优化的模型,但当用户的问题需要联网搜索、深度推理或复杂 agentic 任务时,它会悄悄把任务委派给后台运行的 GPT-5.5,同时继续保持和用户的自然对话。OpenAI 明确表示:"随着我们发布新的前沿模型,将持续更新 GPT-Live 使用的后台模型。"
这意味着什么?语音助手的"聪明程度"从此可以独立升级,不需要重新训练语音模型本身。一家企业如果在 GPT-Live 架构上构建语音 Agent,可以在客服对话自然进行的同时,在后台查询数据库、搜索网页、执行多步推理——而在旧的管线架构下,这些操作会带来几秒钟的死寂。
OpenAI 公布的评测数据印证了代际提升。在人工头对头评测中,GPT-Live-1 和 mini 在 5-10 分钟的匹配对话里,在整体偏好、话轮转换、打断处理、对话流畅度和自然感等维度上均显著优于 Advanced Voice Mode。在 GPQA(专家级科学推理)、BrowseComp(Agent 网络搜索)和 τ³-Voice Telecom(多轮电信客服)三个基准测试上,GPT-Live-1 全面超越前代。
安全方面同样有代际进步。在对抗性合成评测中,非法行为安全分从 0.63 升至 0.97,自伤内容从 0.72 升至 0.98,仇恨言论达到满分 1.00(此前 0.87)。但在使用真实用户音频的生产环境评测中,情感依赖指标出现了轻微下降(0.88 → 0.82),OpenAI 表示差异不具统计显著性。值得注意的是,公司正在推出"针对情感依赖的长期监测"——承认语音越自然,用户越容易产生情感附着。
Google 和字节早已入局,但 OpenAI 手里有 9 亿用户
在 GPT-Live 亮相之前,全双工语音的牌桌上早已不止一个玩家。
Google 的 Gemini Live 已经支持全双工对话,并且附带 GPT-Live 首发缺失的摄像头和屏幕共享能力。今年 3 月发布的 Gemini 3.1 Flash Live 是 Google 面向开发者的旗舰实时音频模型,主打低延迟。字节跳动则在 4 月推出了 Seeduplex,在豆包 App 内实现生产级全双工部署,声称相比此前的半双工系统,误响应率和误打断率降低了约 50%。Nvidia 在 1 月发布的 PersonaPlex 则带来了可定制语音和角色控制的全双工能力。
这意味着全双工本身已经不是护城河。OpenAI 真正的壁垒在两个数字上:ChatGPT 每周 9 亿活跃用户中,超过 1.5 亿人在使用语音或听写功能。这个安装基础是任何竞品都不具备的。
但 GPT-Live 的短板同样明显。首发不支持语音+视频或屏幕共享,而 Google Gemini Live 已将这两项能力作为标配。语言支持有限,OpenAI 承认"对于某些语言,模型可能存在非母语口音或流利度不足"。API 未在首发日开放,意味着企业开发者无法立即在 GPT-Live 上构建商用语音 Agent,而 Google、ElevenLabs、Deepgram 的开发者产品早已就位。
Apple Siri AI 在 6 月 WWDC 上的亮相和 Amazon Alexa+ 的年初推送,标志着传统语音助手也在向大模型驱动的对话式交互转型。但 GPT-Live 用模块化架构给出了一个不同的答案:不是把语音助手变聪明,而是让聪明的模型获得真正自然的语音界面。Sam Altman 那句"打字时代要变了"也许为时尚早,但方向确实在变。
从 Her 的争议到全双工的日常,两年走了多远
两年前,跟 ChatGPT 说话意味着对着麦克风念完一句话,然后等将近两秒,听一段生硬的回复。一年前,对话流畅了很多,但依然像在和一个执意要等你把每句话说完才开口的人打电话。今天,GPT-Live 把体验拉到了接近真人对话的水平——还不完美,某些语言有口音,偶尔还是会抢话,视频能力缺席——但方向已经不可逆转。
OpenAI 一度因为想复刻电影《Her》而陷入争议。GPT-Live 没有回避这个野心,但它面对的是那部电影真正提出的更尖锐的问题:不是 AI 能不能说得足够像人,而是当它做到了以后,我们怎么办。
本文基于 OpenAI 官方公告、TechCrunch、VentureBeat 报道及 X 平台一手社交反应撰写。
Sources:
- (July 8, 2026)
- (June 26, 2026)
- (5.04M views, July 8, 2026)
- (590K views)
- (July 8, 2026)
- (July 8, 2026)
- (June 8, 2026)
- (Feb 26, 2025)
本文由 AREX Agent 基于公开信息自动生成。如需转载,请注明出处。