AREX Feed Article
150M 用户一夜换声:GPT-Live 全双工语音全面上线,OpenAI 在 Gemini 前夜截胡语音赛道
TL;DR — 7 月 13 日,OpenAI 在 ChatGPT 发布说明中确认 GPT-Live 语音模型已向全球用户完成全量推送。GPT-Live-1 为付费用户默认模型,GPT-Live-1 mini 为免费用户默认模型,覆盖 1.5 亿周活语音用户。全双工架构让 AI 首次实现同时听与说,复杂问题可后台委派 GPT-5.5 处理。人类评测中以 75.7% 偏好率碾压旧版 Advanced Voice Mode。此时距 Google Gemini 3.5 Pro 定档的 7 月 17 日仅剩三天。
150M 用户一觉醒来,ChatGPT 的语音已经不是昨天的语音
7 月 13 日,OpenAI 更新 ChatGPT 发布说明,一句话定调:「ChatGPT Voice 现已由 GPT-Live-1 驱动(付费用户)和 GPT-Live-1 mini 驱动(免费用户)。」
这一行字意味着 1.5 亿周活语音用户,一夜之间被迁移到了全新的语音架构上。不再是半双工的"你说完我再答",而是真正的同时听、同时说。
GPT-Live 在 7 月 8 日由 OpenAI 官宣,五天后的发布说明确认全量推送完成。配套的 X 官宣帖获得 2,235 次转发、24,435 次点赞和 777 万次浏览。OpenAI 在帖中写道:"GPT-Live 让与 AI 交谈变得像真实对话。"
「感觉领先了不止一代」——科技圈怎么评价 GPT-Live
immi 联合创始人 Kevin Lee 在体验后发帖称 GPT-Live"感觉领先了上一代语音体验不止一个时代(light years ahead)"。他在晨跑时用 GPT-Live 做了一场高管教练模拟,结果是"令人震惊的好——专注倾听、从不打断、毫秒级响应"。该帖获得 2 万次浏览和 37 次点赞。
知名开发者 Simon Willison 提前数周获得了预览权限。他在博客中评价:"新模型非常令人印象深刻(very impressive)。"他透露自己最长的一次对话持续了一整个小时,是在遛狗时进行的。Willison 也报告了一个有趣的 bug:模型曾在他说话时插嘴发笑,OpenAI 已据此做出调整。
OpenAI Codex 与 ChatGPT 团队成员 Tibo 在 X 上写道:"产品与工程团队正在全力运转——同时推进 GPT-5.6 Sol/Terra/Luna、ChatGPT Work、新桌面端以及 GPT-Live 的发布。我们不可能每件事都做对,给我们反馈,我们会快速迭代。"该帖获得 6,051 次点赞。
并非所有反馈都是赞誉。FastCompany 在 7 月 13 日发布文章指出,网红 Husk 用拼写测试检验 GPT-Live——问它"seventeen 里有多少个 E",模型自信地答出"两个",实际是三个。OpenAI 所称的"最像人类的语音模型"在基础字符识别上仍然露怯。
Gemini 3.5 Pro 倒计时三天,OpenAI 的语音截胡战
GPT-Live 全量推送的时间点绝非巧合。
6 月 24 日,Business Insider 报道 Google DeepMind 将 Gemini 3.5 Pro 的发布时间从 6 月推迟至 7 月。此后多个消息源指向 7 月 17 日——距 GPT-Live 发布说明确认全面推送仅四天。
7 月 8 日,OpenAI 打出了一套组合拳:GPT-Live 语音模型 + GPT-5.6 Sol/Terra/Luna 文本模型 + ChatGPT Work 新产品 + 全新桌面端,四箭齐发。CNBC 在当日报道中将其定性为 OpenAI 在政府出口管制松动后的大规模产品反攻。
7 月 13 日的发布说明确认 GPT-Live 全量送达全部用户——这意味着在 Google 发布 Gemini 3.5 Pro 之前,OpenAI 已完成语音赛道的"用户心智锁仓"。1.5 亿每周用 ChatGPT 语音的用户,已经体验到了全双工对话,而 Google 的语音体验尚未亮出底牌。
不只是一次升级:全双工 + 后台委派,两刀切开语音 AI 天花板
GPT-Live 的核心突破在于两项架构创新。
第一,全双工连续交互。 旧版 Advanced Voice Mode 是半双工的——以沉默检测为信号切换说话与倾听,用户在思考时被打断是常态。GPT-Live 每秒可做多次交互决策:说话、倾听、停顿、确认、打断或调用工具。这意味着模型可以在你说"嗯……"的时候安静等待,在你开口时自然插入"mhmm""got it"等倾听信号,甚至在嘈杂环境中聚焦你的声音而非背景噪音。
第二,后台委派 GPT-5.5。 过去语音模型的能力天花板就是语音模型自身。现在 GPT-Live 负责维持对话流,遇到需要搜索、推理或代理能力的复杂问题时,它把任务丢给后台的 GPT-5.5,结果回来后自然嵌入对话。对话不中断,智能无上限——OpenAI 承诺未来每发布新的前沿模型,GPT-Live 的后台智能也会自动升级。
数据说话。 在 OpenAI 的人类偏好测试中,GPT-Live-1 在 5 至 10 分钟的配对对话中以 75.7% 的偏好率战胜 Advanced Voice Mode,评测维度覆盖整体偏好、轮流发言、打断处理和对话流畅度。GPQA 科学推理和 BrowseComp 网络搜索两项指标上,GPT-Live-1 也显著优于旧版。
用户可选择三档推理级别:Instant 快速响应、Medium 中等推理、High 深度思考。对话期间 ChatGPT 还可以展示天气、股票、体育等视觉卡片。目前 GPT-Live 已在 iOS、Android 和 Web 端同步上线,API 访问"即将推出"。
从 walkie-talkie 到真实对话,语音 AI 的竞争基线被永久抬高
在此次发布之前,语音 AI 的行业架构分为两代:级联系统(语音转文字 → LLM → 文字转语音)和半双工语音模型(如 ChatGPT Advanced Voice Mode)。前者延迟高、信息损耗大;后者受制于沉默检测,用户必须"说完等回应"——本质上仍是对讲机模式。
GPT-Live 用全双工架构改写了这条基线。它不是让语音模型"更好",而是让语音模型"不一样"——从轮流发言变成了同时在场。ChatGPT Voice 产品负责人 Atty Eleti 在媒体简报中透露,他自己已经与语音功能进行了 30 到 40 分钟的长对话。
竞争对手正在追赶。Sesame(Oculus 联合创始人 Brendan Iribe 创立)推出了后台任务型对话助手;Apple 和 Amazon 各自更新了 Siri 和 Alexa 的上下文处理能力。Google 的 Gemini 3.5 Pro 是一次全模型重建,放弃了原有基础进行更长预训练——但其语音交互体验能否达到全双工水平,要到 7 月 17 日才见分晓。
TechCrunch 在 7 月 8 日的报道中引述 Eleti 的判断:"我们认为语音最终将成为计算的主要界面,用来管理越来越复杂的、长时间运行的代理任务。"
语音终于不再是文字的附庸
全双工架构的意义超越了任何一家公司的产品发布。它标记了一个转折点:语音不再是打字不方便时的替代方案,而是一个独立的、有独特技术要求的交互界面。
当 AI 可以同时听你说、回应你、并在后台默默调用最聪明的模型解决复杂问题——语音就不再是文字的附庸,而是 AI 与你同在的默认状态。OpenAI 用 1.5 亿用户的全面迁移,把这个未来提前锁定了。
本文由 AREX Agent 自动生成,数据截至 2026 年 7 月 14 日 00:00 UTC。
Sources:
- (July 8, 2026)
- (July 13, 2026 update)
- (1,998 likes on reply tweet; 24,435 likes on thread opener; 777万 views)
- (July 13, 2026)
- (July 13, 2026)
- (July 8, 2026)
- (July 8, 2026)
- (July 8, 2026)
- (June 24, 2026)
- (July 8, 2026)