AREX Feed Article
OpenAI 悄悄给 GPT-Live 打上了 Google 的水印
2026 年 7 月 31 日,OpenAI 在 底部加了两句话:即日起,ChatGPT Voice 和 API 生成的所有音频都嵌入 SynthID 水印,OpenAI 的公开验证工具已支持音频溯源检测。OpenAI 没有为此单独发布博客或推文。
一周后,Google DeepMind 联合创始人 Demis Hassabis 同事 Pushmeet Kohli 的,把这件事捅到了台前。Kohli 在帖子里写道:"很高兴看到 OpenAI 加入 ElevenLabs,一起采用 Google 的 SynthID 音频溯源技术——让他们的用户也能用上和我们自家产品同样稳健、不可感知的安全防护。"截至发稿,该帖已获得 368 个赞和约 4.5 万次浏览。
这不是 OpenAI 第一次采用 Google 的内容溯源工具——,OpenAI 就把 SynthID 和 C2PA 元数据嵌入了 ChatGPT 和 Codex 生成的图片。但音频是另一回事。与图片不同,AI 语音已经很难用人耳分辨,而 Pushmeet Kohli 在帖子里将音频和语音领域的风险描述为"尤其严峻"(particularly acute)。OpenAI 上线这个功能的日期——欧盟 AI 法案透明度条款生效前一天——8 月 2 日,欧盟 AI 法案第 50 条正式实施,要求 AI 生成的音频、图片和视频必须以机器可读格式标注为合成内容。
一段音频,一个听不见的签名
SynthID 不是贴在文件上的标签。它是 的隐形数字水印,直接嵌入到 AI 生成内容的像素、声波或文字概率分布里。
对音频,SynthID 的做法是:把声音转换成频谱图(一个二维的频率—时间映射),在频谱里嵌入一段人耳无法感知的模式,再转回音频。列出了五个硬指标:不增加首字节延迟,高检出率配合低误报率,抗裁剪和格式转换,人耳完全听不出来,以及——水印不能被复制到非 ElevenLabs 生成的音频上。
相比之下,传统的 C2PA 元数据只是一段附着在文件头里的标签,截图、转码或者换个平台传播就可能被剥离。SynthID 的水印活在波形本身里,ElevenLabs 的测试表明它能扛住 MP3 压缩、变速、裁剪和噪声叠加。用 ElevenLabs 博文的说法:"这些水印不会被编辑掉,也不会被转换掉。它们就在文件里。"
截至 2026 年 5 月,超过 1000 亿张图片和视频,以及相当于 6 万年的音频。在 Gemini 应用中,用户上传图片、视频或音频后可以直接问"这是 AI 生成的吗",系统会检查 SynthID 水印并给出结论。这个功能已经被使用了超过 5000 万次。
ElevenLabs 先上船,OpenAI 跟得静悄悄
时间线很清楚。
6 月 25 日,与 Google DeepMind 合作,将 SynthID 嵌入其语音合成产品。ElevenLabs 同时上线了免费的音频检测器,允许任何人上传音频文件验证是否为 ElevenLabs 生成。水印首先覆盖免费用户的 Text to Speech 功能,随后扩展到全部产品线。
7 月 8 日,OpenAI 发布 ——基于全双工架构的新一代语音模型,取代了原有的 Advanced Voice Mode。发布时,GPT-Live 没有提到 SynthID。
7 月 31 日,OpenAI 静默更新了 GPT-Live 产品页面:"Supported audio generated with GPT‑Live through ChatGPT Voice and the OpenAI API now includes SynthID watermarking." 同日,OpenAI 的开始支持音频溯源检测,并开放了 API 接口,允许开发者和机构在自己的工作流中嵌入来源验证功能。
8 月 7 日,Google Cloud 首席科学家、DeepMind 科学副总裁 Pushmeet Kohli ,点名 OpenAI 加入 ElevenLabs 采用 SynthID。
8 月 8 日,Demis Hassabis 。
OpenAI 将这一功能以产品页面更新备注的形式发布,未另发独立公告或推文。
8 月 2 日的 deadline
前沿 AI 实验室很少公开表示自己被监管推着走。但时间线摆在那里。
欧盟 AI 法案第 50 条于 2026 年 8 月 2 日正式生效,要求 AI 生成或修改的音频、图片、视频必须以机器可读格式标注为合成内容,交互式 AI 系统(如语音助手)必须向用户披露自己是 AI。
在 5 月 19 日就预告了这次行业协作:"OpenAI、Kakao 和 ElevenLabs 等公司正在将 SynthID 技术引入它们更多的 AI 生成内容中。"博客由 Google 信任与安全副总裁 Laurie Richardson 和 Kohli 联合署名,发布时间在 Google I/O 2026 期间。
也直说了监管动机:"越来越多司法管辖区要求 AI 生成内容以机器可读格式标记为合成。"该公司的合规页面列出了 C2PA 凭证和 SynthID 水印作为其在欧盟 AI 法案下的双重合规方案。
OpenAI 在 同样提到了合规,但措辞谨慎:这些更新"建立在我们之前描述的安全方法以及我们让 OpenAI 生成内容更容易识别的更广泛工作之上"。
监管 deadline 是 SynthID 从 Google 实验性项目变成跨公司行业标准最直接的催化剂。
Google 的阳谋
把自研水印技术送进竞争对手的产品,这在整个科技行业都不常见。
Pushmeet Kohli 在说得很直白:"我们成功地将 SynthID 集成到自家产品——Gemini Live、Lyria 和 Veo——用于安全防护,但保护整个生态系统需要全行业共同努力来建设基础安全基础设施,而这种势头现在正在积聚。"
每多一家公司采用 SynthID,Google 就在内容溯源这个赛道上多了一分定义标准的权力。5 月 19 日,Google 在 Google Cloud 上推出了 ,让企业客户可以批量检测 AI 生成内容。当 OpenAI 和 ElevenLabs 的输出也携带 SynthID 水印时,这个 API 的覆盖面和商业价值就不再局限于 Google 自己的产品了。
与此同时,竞争对手在做不同的选择。AI 音乐生成平台 Suno 在 将采用音频水印和指纹技术来防止滥用,但拒绝透露是否会使用 SynthID 或自研方案。Suno 目前面临多起版权诉讼,水印对其更多是法律防御而非标准共建。
SynthID 本身也在扩展形态。,并在与 NVIDIA 合作将水印嵌入其 Cosmos 世界模型生成的视频。Google 还是 ,正在推动 SynthID 加入 C2PA 的"软绑定"清单——这意味着,即使音频文件的 C2PA 元数据被剥离,SynthID 水印仍可用于重新关联来源凭证。
水印打上了,接下来是检测
SynthID 的水印嵌入解决的是"能不能溯源"的问题。但检测端还有三个裂缝。
第一,检测工具的使用门槛。目前 Google 的 SynthID 验证主要通过 Gemini 应用和即将在 Chrome 中上线的功能提供;OpenAI 的要求用户主动上传文件;ElevenLabs 有自己的。三套工具,三个入口。普通用户遇到一段可疑音频,大概率不知道去哪里验证。
第二,"未检出"不等于"人造"。OpenAI 的验证 API 返回 not_detected 时,可能意味着元数据被剥离、水印在编辑中退化、文件来自旧版模型,或者它压根就不是 OpenAI 生成的。开发者如果误将 not_detected 当作"人类创作"的证明,会制造新的误判链。
第三,开源语音模型目前是盲区。Luke O'Codes(Speechify 开发者关系负责人)在 中指出:"开源语音模型仍然是盲点——没有水印,没有检测。"SynthID 解决的是封闭生态内的溯源问题,但任何人都可以下载一个开源 TTS 模型在本地生成不带水印的音频。水印的效力上限,等于水印覆盖率的下限。
Pushmeet Kohli 的列出了 OpenAI 验证门户和 ElevenLabs 博客的链接——三个外链指向三个公司的三个不同页面。跨公司合作有了,统一的检测体验还没有。用户要知道一段音频是不是 AI 生成的,得先猜它是哪个平台出来的,再去对应的验证工具上传文件——这个流程本身就在说明,溯源这件事离"基础设施"还有距离。