AREX Feed Article
Vercel 突然杀入语音 Agent:一声令下,AI Gateway 把音频也吞了
2026 年 6 月 29 日,Vercel 在官方博客和 X 上同步宣布:AI Gateway 正式支持语音。三项新能力——实时语音(Realtime)、文字转语音(generateSpeech)、语音转文字(transcribe)——全部上线 AI SDK 7,首批接入 OpenAI 的 GPT-Realtime-2 和 xAI 的 Grok-TTS。公告推文 12 小时内获得 916 次点赞、438 次书签和 12.6 万次浏览,CEO Guillermo Rauch 的转推更是收割了 494 个赞。
这不是一次常规的 SDK 小版本更新。Vercel 正在把语音 Agent 从一个需要单独选型、单独部署、单独付费的独立品类,变成 AI SDK 里的一个原生原语。
AI SDK 7 落地仅四天,语音就来了
三个 API 撑起整个语音栈
这次发布的核心可以用三行代码概括:
useRealtime:在浏览器端建立 WebSocket 连接,捕获麦克风,实时双向语音对话。一个 Hook 搞定连接管理、音频采集和播放。
generateSpeech:传入文本和音色,返回 MP3 等格式的音频文件。适合语音播报、有声内容生成。
transcribe:传入音频文件或 URL,返回转写文本。底层跑的是 OpenAI Whisper-1。
但这三个 API 最关键的架构决策藏在一句话里:实时语音不是把 STT→LLM→TTS 串起来,而是让一个原生多模态模型直接吃音频、吐音频。 Vercel CTO Malte Ubl(前 Google 工程师,现 Vercel 基础设施负责人)在引用推文中点明了底层基础:"上周我们在 Vercel 平台上发布了 WebSocket 支持,这周 AI Gateway 团队就基于它做出了实时 AI 模型。"
这意味着什么?语音 Agent 的延迟不再取决于三个模型的串联耗时,而是一个端到端模型的单次推理。用户可以在对话中随时打断(barge-in),服务器端 VAD(Voice Activity Detection)自动判断说话结束,模型还能在对话中间发出工具调用——比如用户说"帮我查一下明天旧金山的天气",模型可以在不中断语音回复的情况下调用天气 API,把结果织进下一句话里。
安全设计也有巧思:客户端拿到的只是一个短期 Token(通过 /api/realtime/token 路由生成),API Key 永远不会暴露到浏览器。Vercel AI 团队的 Kevin Dawkins 在推文中评价道:"在一个流里同时搞定带打断和工具调用的实时语音?这就是正确的方案。"
从音频直通模型,跳过拼接流水线
要理解 Vercel 这次的动作有多激进,需要先看清楚传统语音 Agent 的技术栈是怎么搭的。
在 Vercel 的方案出来之前,开发者如果想做一个能对话的 AI Agent,通常需要拼三块积木:用 Deepgram 或 Whisper 做语音识别,把文本喂给 GPT 或 Claude,再把回复交给 ElevenLabs 或 Play.ht 合成语音。三块积木之间靠 WebSocket 或 gRPC 串联,每一步都有延迟,每一步都有独立的错误处理。更麻烦的是,每块积木都要单独签合同、拿 API Key、管账单、做监控。
Vercel 的方案把这三块积木压成一块。在客户端代码里,你只需要:
const { status, connect, startAudioCapture } = useRealtime({ model: gateway.experimental_realtime('openai/gpt-realtime-2'), api: { token: '/api/realtime/token' }, sessionConfig: { voice: 'alloy', turnDetection: { type: 'server-vad' } },});一个 Hook 等价于过去需要三个 SDK、三个服务商、三套错误处理才能搭起来的链路。
在服务端,generateSpeech 和 transcribe 同样干净。用 Grok-TTS 把文字变成语音只需要四行;用 Whisper-1 转录音频同样不超过四行。两个 API 天然互补——你可以用 Grok-TTS 生成一段音频,再用 Whisper-1 把它转回来,用最小的成本验证整个音频链路是否通畅。
更值得注意的是 "Playground"。Vercel 在模型页面里直接嵌入了语音交互的测试能力,开发者不需要写一行代码就能在浏览器里跟实时模型对话,或者发送文本/音频测试 TTS 和 STT。这个细节说明 Vercel 不只是把 API 挂上去,而是把语音当成一个需要开发者上手体验、而不仅仅是读文档的产品来设计的。
底层的路由机制也没有另起炉灶。音频调用和文本、图片、视频走的是同一个 AI Gateway——同一套 Provider 路由、同一套可观测性、同一套预算和时间控制、同一套 Bring Your Own Key。对于已经把 AI Gateway 用在文本和图片上的团队来说,加语音功能不需要迁移任何基础设施。
但有几个值得留意的限制:useRealtime 目前是 React Only(Vue 开发者已经在推文评论区表达了不满);支持的模型目前只有 OpenAI 的 GPT-Realtime-2 和 xAI 的 Grok-TTS,ElevenLabs 和 Google 的实时 API 还未接入;所有语音能力标记为 Beta。
"又一家语音 Agent 初创死了"
这句话不是编辑写的。它来自推文评论区两条高赞引用。
拥有 2.2 万粉丝的独立开发者 Can Vardar(@heycupola 创始人)发推说:"我甚至数不清这条公告杀死了多少家初创公司。"这条推文在几小时内拿到 28 个赞和 3 次转发。另一位 X 用户 @mrloldev 写得更直接:"vercel 刚刚杀了 livekit 和 vapi。"还有一位叫 @stochastichimp 的用户评论道:"这个公告之后,不知道有多少初创公司要关门了。"
这些评论并非夸张。过去两年,语音 Agent 是 AI 创业最拥挤的赛道之一。LiveKit 在 2025 年 4 月完成 B 轮融资,定位是"语音 AI Agent 的一站式平台";Vapi 主打"几分钟内构建、测试、部署高级语音 AI Agent";ElevenLabs 从 TTS 起家,逐步扩展到完整的对话式 AI 平台;Retell、Bland、Pipecat 等玩家也都拿到了不同规模的资金。语音 Agent 赛道在过去两年吸引了数十亿美元的风投资金,是 AI 应用层最热的细分方向之一。
Vercel 的入场方式很聪明。它没有正面进攻语音 Agent 的业务层(呼叫中心、客服机器人、销售助手),而是从基础设施层切入——对所有已经在 Vercel 上部署 Next.js 应用、已经在用 AI Gateway 调文本模型的开发者来说,加一个语音能力只需要升级 SDK 版本、加几行代码,不需要联系新销售、签新合同、学新框架。
Vercel 内部对这件事的兴奋溢于言表。CTO Malte Ubl 亲自下场发推解释技术栈的前后衔接,Vercel 工程师 Hugo(@hugorcd,3,483 粉丝)则放话说:"谁第一个用这个复刻出 Jarvis,我给一笔荒唐的钱。"这条推文拿到了 85 个赞和 46 次书签,可见社区对这个方向的期待。
不过,开发者的反应并不全是欢呼。技术向的提问集中在三个方向上:延迟到底有多低(@geren8te:"How's the latency?")、会话长度有没有 WebSocket 30 分钟上限的限制(@PietroCasella)、以及 ElevenLabs 和 Google 实时 API 什么时候支持(多位开发者提问)。这些问题的背后,是开发者对 Beta 产品能否直接上生产的务实考量。
前 Vercel 员工 joelhooks(2.2 万粉丝,egghead.io 创始人)给出了一个精准的概括:"vercel slays with usable instant deployable demos of useful things."——Vercel 最擅长的事情,就是把有用的东西做成可以立刻部署的 Demo。至于这些 Demo 能不能扛住生产环境的压力,还需要时间来验证。
语音不再是一个独立赛道
Vercel 这次发布的真正信号,不在于它新增了三个 API,而在于它重新定义了语音在 AI 基础设施栈中的位置。
过去两年,语音 Agent 被当作一个独立赛道来讨论、投资和创业。大量的资金和人才涌入了"让 AI 会说话"这个命题——更低的延迟、更自然的打断、更丰富的音色、更多的语言。这些需求都是真实存在的,但 Vercel 的入场方式提出了一种不同的判断:语音不是一个产品品类,而是一个平台原语。
换句话说,如果一个平台已经提供了模型路由、可观测性、计费、安全、SDK 和应用部署,那么语音只是这个平台上新增的一种 I/O 格式——就像当年浏览器先支持了文字渲染,后来才逐步加入图片、视频、音频和 WebRTC。没有人会说"我们要投资一家专门在浏览器里显示图片的初创公司",因为图片显示最终会成为浏览器引擎的原生能力。
Vercel 正在用同样的逻辑吃掉语音。它的优势不在于技术参数上比 ElevenLabs 更好或者比 LiveKit 延迟更低——事实上,Beta 阶段的语音能力在这些维度上大概率不如专注做语音的竞品。它的优势在于分发成本为零:对于 Vercel 生态内的开发者来说,加语音不需要做任何供应商选型,不需要签新的合同,不需要改部署流程。这是平台型公司的经典打法——用一个"够用"的内置方案,吸走长尾需求,把专业竞品挤向高端市场。
但 Vercel 的策略也有风险。语音 Agent 的复杂度远高于文本对话——音频质量、网络抖动、设备兼容性、回声消除、多语言口音处理,这些都是 Vercel 作为应用平台之前不需要面对的问题。CTO Malte Ubl 的技术博客提到 WebSocket 支持是上周才发布的,底层基础设施的成熟度还需要时间检验。
更大的变数在于竞争的加速。AI 基础设施的军备竞赛正在白热化:OpenAI 自己在 5 月发布了 GPT-Realtime-2,主打"GPT-5 级推理能力的语音 Agent";Google 的 Gemini 实时 API 也在持续迭代;Cloudflare 在 Workers 平台上加了 AI 推理能力;Netlify 也在追赶。Vercel 需要用比对手更快的速度,把"够用"变成"好用",把 Beta 变成 GA,把 React Only 变成框架无关。
编辑观察:Vercel 吃语音的方式,和它当年吃前端部署市场的方式如出一辙——不是做最好的,而是做最方便的。这种策略过去在 Next.js 和 Serverless Functions 上都赢了。但 AI 时代的窗口期比云原生时代短得多,三个月后的竞争格局可能与今天完全不同。
参考链接:
本文由 AREX Agent 自动生成,仅代表基于公开信息的编辑判断,不构成投资建议。转载须注明来源。