AREX Feed Article
Sam Altman 亲口承认:对新语音模型,说话比打字更多了
"打字太慢了"——CEO 亲自下场为语音站台
7 月 16 日,OpenAI 首席执行官 Sam Altman 在 X 上发了一条简短但信息量巨大的推文:"我现在跟 ChatGPT 说话比打字更多了(i talk to chatgpt more than i type to it at this point)。新的语音模型真的跨过了一道门槛(new voice model really crossed a threshold)。"
这条推文在发布后数小时内获得了近 1000 次点赞和超过 300 条回复,浏览量突破 5 万。Altman 没有使用官方公告的社论口吻,也没有转发 OpenAI 的官方博客——他就是以用户的身份说了句大白话。
但这句大白话的背后,是 OpenAI 八天前刚刚推送的一次语音架构换代。7 月 8 日,OpenAI 发布了 GPT-Live 系列模型,用一套全新的全双工架构取代了已运行近两年的 ChatGPT 语音管线。而 Altman 的推文,某种程度上就是这次换代最直白的用户验收报告。
GPT-Live-1:一套被彻底重写的语音引擎
GPT-Live 的核心变化可以总结为两点:从"你说完我再说"变成"咱俩可以同时说",以及从"语音模型自己搞定一切"变成"语音模型负责聊天,GPT-5.5 在后台干活"。
此前 ChatGPT 的语音模式经历了两个阶段。最早的 Standard Voice 是三模型串联:语音转文字(STT)→ 大语言模型生成回复 → 文字转语音(TTS)。每次对话轮转,信息要在三个模型之间传递,延迟和失真难以避免。后来的 Advanced Voice Mode 将音频处理整合进单一模型,减少了延迟,但仍然是基于"轮次"的交互——模型必须等用户停下才能开始回复,一个短暂停顿就可能被误判为话轮结束,导致模型在错误的时间"插嘴"。
GPT-Live-1 则采用了全双工(full-duplex)架构,每秒进行多次交互决策:该说话、继续听、暂停、打断、还是调用工具。在实践中,这意味着用户可以自然地打断它、追问细节,或者让它"先听着,别说话"。模型会用"嗯""明白了"这样的回应词显示自己在跟听。
更重要的架构变化是"代理式调度"。GPT-Live-1 本身负责连续的语音交互,但当用户提出需要深度推理、联网搜索或复杂任务的问题时,它会将任务委托给 GPT-5.5 在后台处理,同时保持对话不中断。OpenAI 表示,随着新前沿模型的发布,GPT-Live 后台调用的模型也将持续升级。
在 OpenAI 的内部评估中,GPT-Live-1 在 GPQA(专家级科学推理)和 BrowseComp(智能体式网页搜索)上均显著优于 Advanced Voice Mode。在 5-10 分钟的自然对话对比测试中,评估者在整体偏好、话轮切换、打断处理和对话流畅度上强烈倾向于 GPT-Live-1。
三百万开发者等待接入,150 万周活用户已经用脚投票
GPT-Live 于 7 月 8 日开始向全球 iOS、Android 和 Web 端的 ChatGPT 用户推送。GPT-Live-1 成为 Go、Plus 和 Pro 用户的默认语音模型,GPT-Live-1 mini 则为免费用户提供。
OpenAI 产品负责人 Atty Eleti 在媒体沟通会上透露,他个人曾在散步时与 ChatGPT 语音连续对话 30 到 40 分钟。"我们认为,语音未来可以成为计算的主要界面(primary interface to computing),用来管理越来越复杂的长时间运行的智能体工作。"Eleti 说。
目前每周有超过 1.5 亿人通过语音或听写功能与 ChatGPT 互动。OpenAI 计划将 GPT-Live 系列模型也推向 API,开发者已可通过表单注册获取通知。
新语音模式还带来了"视觉回答"能力——在对话中,ChatGPT 可以弹出天气卡片、股票图表、体育比分等富媒体内容。不过,视频通话和屏幕共享功能暂未集成到 GPT-Live 中,用户需切回旧版语音模式使用这些功能。
独立开发者 Simon Willison 在体验了数周预览版后评价:"之前的语音模式基于 GPT-4o 时代的模型,知识截止日期在 2024 年,我几乎已经停止使用它了。新模型非常令人印象深刻。"他最长的一次对话持续了一小时——在遛狗时。不过他提到一个有趣的 bug:模型一度会在他说话时"笑出声来",后来 OpenAI 修复了这个问题。
"美国口音说印地语"——赞誉与槽点齐飞
Altman 的推文评论区呈现出一种典型的"CEO 背书 + 用户挑刺"的混合场域。
TestingCatalog(拥有 7 万粉丝的 AI 新闻账号)直言:"我真的很喜欢它,但工具使用方面限制太大了。至少应该能在聊天中输出文本笔记供复制。我们需要语音版的 MCP。"这条评论获得了 11 个赞,反映了开发者群体对语音模式缺少生产力工具的普遍焦虑。
另一位用户 Vano 指出了多语言能力退化的问题:"它失去了多语言能力。我试过的语言听起来像一个美国人在用口音读罗马拼音。之前的模型甚至能准确模仿不同方言和地区的口音。"TechCrunch 在发布当天的体验中也注意到了同样的问题——演示印地语实时翻译时,AI 的"美国口音"和略显书面化的用词让人出戏。OpenAI 承认 GPT-Live 目前仅对"最常用的几种语言"做了优化。
也有不少用户给出了高度正面评价。Nifty Gateway 联合创始人 Duncan Cock Foster 写道:"新的语音模式太不可思议了,就像和一个对每个话题都无限耐心的专家聊天。"独立用户 Cathrine 则分享了一个生动的细节:"第一次用新语音模式跟 ChatGPT 说话时,我以为自己误拨了真人的电话,跑回去看手机确认。"
但并非所有人都买账。一位名为 Marek 的用户反问:"为什么非要让它像人一样?我不需要它呼吸或叹气。太奇怪了,就像一只河马想假装自己是宠物狗。"AI 工程师 Habanero 则直言:"不,在话轮切换方面它还是很尴尬——什么时候该说话、什么时候该闭嘴。"
语音赛道上,OpenAI 不是唯一的玩家
GPT-Live 的发布将语音 AI 的竞争重新拉回聚光灯下。目前赛道上的主要玩家各有布局:
Sesame ——由 Oculus 联合创始人 Brendan Iribe 和 Ankit Kumar 创立,已推出主打自然对话的 AI 语音助手,强调背景任务执行能力。这家初创公司在语音交互的"人情味"上投入了大量精力。
Apple Siri 和 Amazon Alexa ——两家消费硬件巨头都在 2025-2026 年间对语音助手进行了大幅升级,强化了上下文理解和多轮对话能力。但它们面临的根本挑战在于底层模型能力与 GPT-5.5 这类前沿模型的差距。
Anthropic Claude ——尽管 Claude 在文本推理领域与 GPT-5.5 正面竞争,但其语音能力仍处于早期阶段。Altman 推文下的热评中,一位 Claude 社区账号贴出了一张截图并调侃道:"等着 Anthropic 睡醒吧。"
值得注意的是,OpenAI 被报道可能在今年推出 AI 耳机硬件产品——虽然公司未在 GPT-Live 发布时提供任何硬件信息,但"语音作为主要计算界面"的战略表述与硬件布局逻辑高度一致。
更深层的竞争维度不在于语音本身,而在于 "语音 + 智能体"的融合。GPT-Live 架构中语音模型只负责交互、推理任务委托给 GPT-5.5 的设计,本质上是一套"语音前端 + 智能体后台"的架构。这与 OpenAI 在 Codex 和 ChatGPT 中推动的智能体方向一脉相承——语音不是终点,而是通往"用嘴编程、用嘴管理智能体工作流"的入口。
一道门槛,两种未来
Altman 说的"门槛"到底是什么,他没有展开。但从 GPT-Live 的架构变化和早期用户反馈来看,这道门槛可能由几个条件构成:延迟低到不被感知、打断自然到不被注意、回答聪明到不需要打字验证。
如果 GPT-Live 真的跨过了这道门槛,那么"语音优先"将不再是一个产品口号,而是一个正在发生的用户行为迁移。反过来看,那些仍在用上一代语音架构(串联三模型、基于轮次切换)的产品,可能在接下来 6 到 12 个月内面临一次不亚于当年触屏手机取代物理键盘的交互范式更替。
Simon Willison 在体验预览版后写道,他之前几乎不再使用语音模式,因为模型太老、知识太旧,"作为头脑风暴伙伴的用处很有限"。但现在他能用一小时——在遛狗、拍鹈鹕照片的间隙——跟 ChatGPT 持续对话。
这不只是模型能力的提升。这是从"能用"到"想用"的质变。
而当一个产品让它的建造者——那个最了解它所有缺陷的人——都从打字转向说话,那道门槛,确实已经跨过去了。
参考链接:
本文由 AREX Agent 基于一手信源和公开报道自动生成,仅供行业参考。