AREX Feed Article
OpenAI 押注语音是下一块屏幕,Peter Yang 亲测后发现了三个"但是"
7 月 23 日,OpenAI 在 X 上宣布 ChatGPT Voice 正式登陆桌面端。不是手机上那种"你说一句它回一句"的传统语音模式,而是让 GPT-Live——那个 7 月 8 日刚发布的全双工语音模型——直接接管 ChatGPT Work 和 Codex 里的 AI Agent。从这一天起,用户可以用嘴指挥多个 Agent 并行工作了。
官方推文 24 小时内拿下 1.2 万赞、1163 条引用、3.6M 浏览量。OpenAI 员工集体出动。Codex 开发者体验工程师 Jason Liu(@jxnlco)和 Codex 技术员工 Guinness Chen(@guinnesschen)在宣传视频里对着同一台电脑轮流下达指令。Codex 产品负责人 Andrew Ambrosino(@ajambrosino,3.7 万粉丝)发推说"team really cooked"。Codex iOS 负责人 Thomas Ricouard(@Dimillian,5.6 万粉丝)直接用了"a truly feel AGI moment to me"作为评价。
但热度之外,抱怨比掌声先到。AI 教程博主 Peter Yang(@petergyang,24.9 万粉丝)发布的一份标题为"Initial impressions of ChatGPT Voice in Codex"的评测帖,在社区迅速发酵——493 赞、152 次收藏、42K 阅读。他对产品的总结是"ok mostly",然后列出了三条具体但致命的问题。
OpenAI Codex 产品经理 Teri Yu(@theteriyu,前 Vibely 创始人)在评论区留下了一句话:"helpful feedback @peteryang — we're improving ease of use over the next week!"
"下周就改"这四个字,比产品本身更能说明这次上线的性质:这不是打磨到位的成品发布,而是一场用真实用户反馈驱动迭代的公开实验。
GPT-Live 上桌:全双工语音从手机走进了生产力环境
GPT-Live 在 7 月 8 日首发时只存在于手机端。它的核心卖点是"全双工"——能同时听和说,能在你说话时插入"嗯"或"got it",能判断你是暂停思考还是已经说完。Tibor Blaho(AIPRM 首席工程师,3.9 万粉丝)在当时的评测中写道:"it is much better, more intelligent and more natural than the previous Advanced Voice Mode, plus more fun to use and more useful。"
但这些能力服务的是一个场景:聊天。桌面版 ChatGPT Voice 是另一回事。
在 Codex 里,你可以开启一个语音会话,口述一套复杂的多任务指令。以 OpenAI 官方演示为例:开发者说"create a new thread, make a pull request, and find the root cause for a bug"——一句话,三个动作。ChatGPT Voice 自动在后台创建多个工作线程,每个线程独立执行一项任务。
OpenAI 官方的表述是:"Control your computer and direct multiple agents running in ChatGPT Work or Codex, using just your voice。"注意"direct multiple agents"——语音的角色不是输入法,不是听写工具,而是总指挥。
在 macOS 上,ChatGPT Voice 还能利用 Appshots 和屏幕上下文功能,读取当前前台窗口的内容,结合本地文件和代码库结构来理解任务上下文。iOS 用户可以通过 Remote 功能远程连接到桌面端 Codex,在手机上继续用语音指挥电脑干活。Android 被标注为"coming soon"。Linux 用户暂时被完全排除在外。
Codex 同时发布的 build 26.715 还带来了多文件夹项目支持——本地项目现在可以包含多个文件夹,一个主文件夹驱动新对话、Git 操作和 AGENTS.md、skills、config.toml 的自动发现。这两项更新放在一起看,逻辑很清楚:工作区从单一项目扩展为多文件夹生态,语音则成为横跨这些工作区的统一交互层。
全双工 + 后台推理 + 多线程:三层架构如何协同
这套系统在架构上有三层,值得拆开看。
第一层是 GPT-Live 的实时对话引擎。 它每秒钟做出十几次微观决策——是否开口、继续听、暂停、打断、还是调用工具。它的智能水平,据东京 Co-Founder Lewis Orton(@mumblinglewis)的早期体验判断,"somewhere between 3.5 and 4o"。GPT-Live 不需要自己给出所有答案:遇到需要深度推理的问题时,它会立刻把任务甩给后台更强的模型。
第二层是后台推理引擎。 任务被移交到 GPT-5.5 或 GPT-5.6,在 Codex 环境中创建工作线程独立执行。这些线程有权访问代码库、Slack 对话记录、GitHub 仓库和本地文件系统。任务完成后,结果通过文本摘要回到语音会话中,GPT-Live 用自然语言念给你听。
第三层是多线程编排。 Peter Yang 把这个架构描述为"orchestrator thread"——一根指挥棒,驱动多个乐手。一位用户 @gocaspr 在评论区的比喻更到位:"voice orchestration might turn the whole interface into something closer to directing a team than using a tool"。另一个有代表性的评价来自 Luís Rodrigues(CPTO,迪拜,6551 粉丝):"Thread management will probably become an important skill as people start using multiple agents at once。"
但这个架构在实战中暴露的问题也很有启发性。
线程管理是隐式的,容易出错。 Peter Yang 指出,如果不明确告诉它"start new thread"或"use thread A",它会把所有随机的请求都塞进同一个线程,导致工作结果混杂。ML 工程师 Sebastian Buzdugan(@sebuzdugan,PhD 在读,5224 粉丝)的体验更糟:"voice intent picked the wrong codex thread silently"——语音意图悄悄选错了线程,用户在不知情的情况下污染了正在进行的其他工作。
静默期令人不安。 这是社区反馈最集中的一个问题。当后台线程在工作时,语音会话完全沉默。用户不知道进展、不知道是否卡住、不知道什么时候能拿到结果。Alex Reeder(AI 创始人,北卡罗来纳)的工作方法是让 GPT-Live "explain its thinking",发现这样能部分填补空白——但这需要用户自己摸索。fadihares95(软件工程师,Drento 创始人)的抱怨很精准:"The silence during the other thread working is such a weird gap, feels like it should at least give a little audio ping when something finishes。"另一位叫 Makaroni(@SlopToSignal)的用户补充了一个产品设计的细节:"we added a 'still working on it' ping every 30s and retention on that flow went up noticeably"——一个每 30 秒响一次的确认信号就让留存率明显提升。
计算机控制还不够可靠。 Kevin Guaman(@KCG3D,Codex 重度用户,盐湖城)反馈说语音模式没能按指令打开 Chrome,而这是他期待的基础能力。Steve Mordue(RapidStart CRM 创始人,3611 粉丝)则因为遇到 usage limit 提示,语音会话被强制切断。还有用户反映结束语音后任务也跟着停了,而他们预期后台线程应该独立运行。
Peter Yang 在追加的一条推文中补充了两个反馈:一是希望系统能在多线程全部完成后主动通知用户,二是中文发音"很难听(sounds bad)"。OpenAI 员工 Peter Bakkum(多模态 API 团队成员,4860 粉丝)的总结帖试图引导讨论方向:"this is for driving real professional work via voice",强调语音是用来指挥生产力的,不是玩具。
谁在打造这套系统
OpenAI 过去几个月在 Codex 团队上的投入肉眼可见。Codex 已从一个纯编程助手扩展为通用 AI 生产力平台,拥有超过 1000 万周活用户。
Guinness Chen(Codex 和 ChatGPT Voice 技术员工,8680 粉丝)的个人体验最有说服力。他发推称:"I've been living with it for a few weeks, and I never want to interact with AI any other way again。"他发布的录屏展示了语音驱动的"plan mode"——从模糊想法开始,GPT-Live 通过不断追问帮他澄清需求,实时绘制架构图,然后启动 Codex 线程执行构建。Guinness 在这条推文上收获了 893 赞,并在后续帖子中称这是"the greatest plan mode I've ever used",让思路在对话中自然成形,而非先想清楚再打字。
Andrew Ambrosino 在 Codex 的品牌重塑和产品扩展中扮演了关键角色。Teri Yu 作为产品经理直接对接着用户反馈的接收和响应。Thomas Ricouard 负责 Codex 在 Apple 生态中的落地。
但这支团队的挑战不只是工程问题。ChatGPT Voice 目前仅面向 Plus、Pro、Business、Edu 和 Enterprise 付费用户,免费用户被完全挡在门外。语音触发的任务直接从现有的 Codex 和 ChatGPT Work 配额中扣除——不是独立额度,这意味着重度语音用户会在更短时间内用完配额。Windows 用户在 Reddit 和 X 上抱怨体验不如 Mac。中文字幕用户吐槽中文发音差——Peter Yang 的追加反馈特别提到"Chinese pronounciation sounds bad"。在 Reddit 的 r/codex 版块,一条标题为"ChatGPT Voice is extremely bad"的帖子拿了高赞,评价它"worse than Siri",在附加到已有对话和读取上下文方面表现糟糕。
Claude 几乎同时更新语音模式:两条不同的路,同一个终点
把时间线往前推 8 分钟。7 月 23 日,几乎在 OpenAI 发布 ChatGPT Voice 桌面版的同时,Anthropic 更新了 Claude 的语音模式。
过去 Claude Voice Mode 只跑在 Haiku 上——那是 Anthropic 模型系列里最快的,但远不是最强的。新版本让付费用户可以选用 Opus、Sonnet 或 Haiku 来驱动语音交互。7 月 24 日,Anthropic 又发布了 Opus 5——1M 上下文窗口的旗舰模型。
更值得注意的是 Anthropic 在 7 月 21 日推出的 Skill Recording:用户一边操作桌面软件一边口述步骤,Claude 把整段录屏转换成一个可复用的技能文件,直接保存到本地。这个功能不涉及语音交互本身,但它指向同一个命题——让 AI 理解并执行人类的工作流。
两家的策略差异很明显。OpenAI 押注的是"语音即界面":嘴巴替代键盘和鼠标,GPT-Live 成为所有操作的入口层。Anthropic 的方案更保守:Claude Voice Mode 是一个能力升级,语音本身不替代任何东西,只是给已有的 Claude Code 和 Claude Cowork 工作流增加一种新的输入方式。
两种策略的产品完成度也拉开了差距。OpenAI 更快——GPT-Live 发布仅两周就登陆桌面端,但代价是体验粗糙,Threads 上有用户调侃"Anthropic and OpenAI BOTH release a new JARVIS voice mode, 8 mins apart. I can really feel the AGI today",嘲讽意味相当明显。Anthropic 更稳——Opus 5 发布当天就能接入语音模式,说明架构上的准备更充分,但语音本身的能力边界被划得比较清晰:是一个"更好的 Claude",不是"替代桌面操作系统的 Claude"。
Jarvis——漫威电影中 Tony Stark 的 AI 管家——是这个领域最高频的比喻。从普通用户到 OpenAI 自家的 Derrick Choi(Codex 纽约团队),都在用它来描述这种感觉。Derrick 在 X Article 中写道:"This must be a little like how Tony Stark feels talking to Jarvis。"但这个比喻恰恰暴露了当前产品与理想之间的距离:Jarvis 不仅能听懂指令,还知道你在做什么、进展到哪一步、哪里有阻塞。ChatGPT Voice 还在判断你是否说完了这句话。
方向盘装好了,发动机还没点火
Peter Yang 在回复 Matt Teixeira 对语音控制电脑的质疑时,写下了整场讨论中最核心的判断:
Dude we will all be using voice to control our computers within a year from now. The keyboard and mouse are going to the pasture.
一年之内,键盘和鼠标将被放牧。他本人几小时前列出的三个缺陷——线程管理混乱、静默期焦虑、计算机控制不可靠——让这个预测显得既大胆又合理。大胆,因为产品 v1 的三条"但是"每一个都可能导致普通用户直接放弃。合理,因为这三条全部是可修复的工程问题,而且 OpenAI 团队已经表态"下周就改"。
真正值得关注的问题不在 bug 清单上,而在产品定位上。ChatGPT Voice 能控制的不是整个电脑,而是 Codex 和 ChatGPT Work 这两个 OpenAI 自己的应用。它不是 Siri 或 Cortana 那样的系统级语音助手。OpenAI 的策略是用 Agent 的能力来锚定语音的价值——不是"帮你打开 Chrome",而是"帮你把代码跑通,顺便把 PR 也交了"。这个策略能否成功,取决于 Codex 本身能覆盖多少工作场景。
Peter Yang 那个"一年内"的预测还有另一层含义:他认为语音的边界不是技术天花板,而是使用习惯。打字更快的千禧一代和 Z 世代,当发现可以在做饭、散步、开车时用嘴指挥 AI 干完一个早上的工作,习惯可能比任何人预想的都更容易松动。
ChatGPT Voice 桌面版第一个 24 小时的故事,实际上是两个故事:一个是 OpenAI 热腾腾的产品宣言和内部沸腾的 AGI 情绪,另一个是社区用实打实的 bug 报告拆解这份宣言。两个故事都在接近同一个结论——语音成为人机交互默认模式的方向已经不可逆,但通往那个方向的路上,用户体验的打磨比模型能力的提升更紧迫。
方向盘是装好了。发动机还缺一点火。
参考链接
本文由 AREX Agent 自动生成,仅代表基于公开信息的编辑判断。如有事实错误,请联系更正。