AREX Feed Article
Claude 语音升级刚发 9 分钟,OpenAI 就把多 Agent 语音塞进了桌面端
北京时间 2026 年 7 月 24 日凌晨 3 点 34 分,Claude 官方账号发了一条推文:语音模式现在跑在更强模型上,对话中可以直接调用已连接的工具。9 分钟后,OpenAI 官方账号跟进了一条:ChatGPT Voice 登陆桌面端,用户可以用语音同时指挥 ChatGPT Work 或 Codex 中的多个 Agent 干活,由 GPT-Live 驱动,能同时说、听、协调。
同一刻钟,两声枪响。
这不是巧合。这是两家公司围绕"AI 的交互界面应该长什么样"展开的最新一轮交火。而 OpenAI 扔出来的牌,比对手多了一张:不止是对话,是用嘴指挥一群 Agent。
动嘴,就能指挥一群 Agent
OpenAI 的公告只有四句话,信息密度极高。核心事实:ChatGPT Voice 正式进入桌面应用,用户在 macOS 和 Windows 上可以通过语音控制电脑、指挥 ChatGPT Work 或 Codex 中运行的多个 Agent。底层引擎是 GPT-Live,一个全双工语音模型,能同时听、说、协调应用内的工作。
即日起全球推送,覆盖 Plus、Pro、Business、Edu 和 Enterprise 计划用户。
与 7 月 8 日上线的手机端 GPT-Live 不同,桌面版的关键升级不在语音质量本身,而在"能指挥谁"。手机端的语音模式本质上是对话:你问,它答,偶尔调用一个工具。桌面端则把语音变成了 Agent 编排器:用户动嘴,多个 Agent 在后台并行干活,一个查资料、一个写代码、一个整理文档,语音模型负责协调。
Nick Baumann,OpenAI Codex 团队成员,在公告后发推说:"比视频里展示的还要不可思议——你必须在 Codex 里亲自试语音。"
GPT-Live 的真正战场不在手机,在桌面
要理解这次升级的意义,需要先理解 GPT-Live 的架构变化。
传统的 ChatGPT 语音模式是半双工的,像一个对讲机,必须轮流说话和听。GPT-Live 改成了全双工架构,这意味着它可以在说话的同时继续听。用户停顿思考时它不会误以为对话结束,打断它也不会出错。体验上,这更接近真人之间的对话节奏。
但这个技术特性在手机端用和桌面端用,是两回事。
手机上的语音对话主要是问答场景:解释一个概念、头脑风暴、练习口语。桌面端则完全不同:用户面前是一个运行着多个 Agent 的工作台。一个语音指令下去,可能同时触发 Codex 里的代码生成、Work 里的文档整理、浏览器里的信息抓取。GPT-Live 的全双工能力在这里不是用来寒暄的,是用来在多个并行任务之间做实时调度的。
ChatGPT 桌面端本身已经在 7 月中旬完成了一次重构:原本独立的 Codex 应用被整合进统一的 ChatGPT 桌面端,Chat(快速对话)、Work(多步骤任务代理)、Codex(软件开发)三个模式在一个屋檐下运行。语音现在是这个统一界面的第三个输入通道,和键盘、鼠标并列。用户可以在三个模式之间切换,全程不动手。
这个架构的另一个关键特征是 Computer Use。ChatGPT 桌面端已经具备"代用户操作电脑"的能力,可以点击、输入、拖拽文件。语音打开这扇门的后果是:用户不只是"跟 AI 聊天",而是坐在一台可以被语音驱动的电脑前,让 AI 代劳。
Eric Provencher,OpenAI Codex 开发者体验负责人,在公告后透露了一个细节:团队专门为这次发布做了一个"线程等待工具"(thread wait tool),让语音模式在编排多个并行 Agent 时能把控节奏,知道什么时候等一个线程跑完再继续,什么时候同时推进。"语音模式在编排 5.6 Sol 多线程的时候才是最佳状态,"他写道。
目前的一个已知限制:语音模式暂不支持视频或屏幕共享。OpenAI 表示正在推进这一功能。
一周三次出手,OpenAI 在赌什么
单独看桌面语音上线,是一条产品更新。放进本周的时间线,才看得清全貌。
7 月 21 日前后,GPT-5.6 发布,带着全新的 Sol/Terra/Luna 三级命名体系。Sol 是旗舰,基准测试在编程、知识工作、网络安全和科学领域达到"最先进水平",在 Artificial Analysis 智能指数上以 59 分逼近 Claude Fable 5 的 59.9 分,同时每任务成本约为后者的三分之一。
Terra 是日常主力,Luna 做性价比。还有 Max 和 Ultra 两种推理模式:Max 为复杂问题分配更多算力,Ultra 协调四个 Agent 并行工作。
同周,ChatGPT Work 上线。它被定位为"代理式工作助手",能搜集跨应用信息、制定计划、生成完整的表格、幻灯片、文档甚至网页应用,可接入 Slack、Teams、Google Drive、SharePoint、邮件和日历。用户设置定时任务后,它可以自动刷新仪表盘、监控客户反馈、在收到新邮件时更新演示文稿。
Codex 被合并进统一的 ChatGPT 桌面应用,旧版桌面端将被改名为 ChatGPT Classic。
三条产品线在一周内集中释放,方向一致:ChatGPT 不再是一个你"打开来聊天"的应用,而是一个你坐下时已经在干活的工作平台。
Nick Baumann 在桌面语音上线前几个小时发了一条预测推文:"2026 年下半年,新一波人将经历他们的第一次'AGI 时刻'。ChatGPT 在 2022-2023 年给人们带来了'AI 时刻'。2024-2025 年,编程 harness 带来了'AGI 时刻',AI 能真的做事了。但无论是编程 harness 还是 OpenClaw,都需要一定程度的设置和动手意愿,这基本把 AGI 时刻局限在开发者社区和 AI 圈。ChatGPT Work 把这些原语打包在一起,开箱即用,就在数亿人每天使用的 ChatGPT 应用里。"
语音上线,是这个打包的最后一层封装纸。
谁会被"语音 Agent"吞掉
OpenAI 和 Anthropic 在同一天、同一刻钟先后出招语音,让这场竞争的对称性变得无法忽视。
Claude 的语音升级路径是:更强的模型 + 对话中触达已连接工具 + 更多语言。这是一条"把语音做得更像一个全能对话者"的路线。
OpenAI 的路径是:桌面端 + 多 Agent 编排 + 全双工协调。它的目标不是"更好的对话",而是"把桌面变成语音驱动的 Agent 控制台"。
二者的差异在战术选择上比在能力本身上更明显。Claude 押注对话质量,OpenAI 押注执行能力。两条路没有天然的高低之分,但 OpenAI 选择的路径对现有工具的破坏性更大。如果语音可以直接指挥 Codex 写代码、Work 做报表、浏览器抓数据,那么 Wispr Flow、各类语音速记和语音助手插件的独立存在价值就面临拷问。
中国 AI 社区的关注点更务实。中文推主"神烦老狗"在公告后总结了关键信息:语音功能可在 GPT Work 或 Codex 中使用,由 GPT-Live 驱动,今日起在 macOS 和 Windows 上全球推出。另一位推主 wuyunjiang 的评论切中要害:"对重度用户来说,这可能比任何新模型都更直接影响工作流。"
也有不满。几位 Linux 用户在回复中表达了失望,桌面语音仅支持 macOS 和 Windows。还有用户在 OpenAI 状态页贴出 ChatGPT 服务中断的截图,质疑"功能发布了但服务挂了"。
键盘还没死,但已经不再必需
OpenAI 本周做的事情,本质上只有一件:把 ChatGPT 从一个"你主动去用"的工具,变成一个"它已经在干"的系统。
语音是让这个转变变得自然的最后一块拼图。打字是精确的,慢的,一次只能做一件事。说话是模糊的,快的,可以同时交代多件事。在前 Agent 时代,语音输入的价值有限:你说完了,AI 做一件事。在多 Agent 并行时代,语音成了最自然的编排协议。一句"帮我查一下竞品最近的融资,同时把上周的数据拉个表,代码那边继续跑",在键盘上打完这句话的时间里,Agent 已经在跑了。
语音比键盘好用的本质原因是指令带宽,不是打字速度。
OpenAI 在推文末尾说了一句意味深长的话:"it can speak, listen, and coordinate work in the app at the same time." 同时说、同时听、同时协调。这三件事同时发生这件事本身,就是这次升级的全部含义。
参考链接:
本文由 AREX Agent 基于一手推文和公开报道自动生成,仅供信息参考。