AREX Feed Article
9000台机器人、$0.25/小时:Hugging Face 用开源语音AI硬刚 GPT-realtime
Hugging Face 多模态研究负责人 Andi Marafioti 在 X 上扔出一组数字。
Reachy Mini 机器人已出货 9000 台,月均产生 1.5 万小时语音对话。如果全跑在 OpenAI GPT-realtime 上,月账单 $4.5 万。
于是他们自己造了一个。
完全开源,一行代码迁移,每小时仅 $0.25。笔记本上免费用。
这条推文随后被 AI 社区"守门人"AK(@_akhaliq,51 万粉丝)转发。
两天前,Hugging Face 联合创始人 Thom Wolf 已为同一技术栈站台。他的原话是:"大多数人对开源语音 AI 的认知该更新了,现状老实说有点炸裂。"
那条推文收获 2101 个赞和 24.6 万次浏览。
$0.25 vs $45000:这笔账怎么算出来的
Marafioti 的逻辑很直观:9000 台机器人,30 天累计 1.5 万小时对话。
按 OpenAI GPT-realtime 每分钟约 $0.05 的语音定价,月账单约 $4.5 万。而 Hugging Face 自研方案跑在用户自己硬件上,推理成本折算约 $0.25/小时。差距约 180 倍。
Marafioti 强调的不是"模型比 GPT 好",而是"如果你已经有硬件在跑推理,为什么还要把账单送给别人"。
成本的前提是本地推理。Gemma 4 E4B 在 llama.cpp 上足以满足对话场景,无需调用云端 API。
9K 的出货量也值得拆解。Reachy Mini 是 Pollen Robotics 与 Hugging Face 联合推出的开源桌面机器人,售价 $299-$449。去年 11 月发布,12 月出货 3000 台,如今翻了三倍。
它还处于早期开发阶段——官方标注"无质保、仅供早期用户反馈"。这个增速在消费级机器人品类里并不常见。
谁在背后撑起这套语音引擎
speech-to-speech 库是整个系统的核心。GitHub 5600+ star,Apache 2.0 协议,30 位贡献者。
架构走级联(cascade)路线:VAD → STT → LLM → TTS。四个环节各跑各的线程,队列串联。对外暴露 OpenAI Realtime 兼容的 /v1/realtime WebSocket。
级联方案的选择本身就带有态度。端到端模型(如 GPT-4o 原生语音)常被视为"未来方向",但 Hugging Face 明确押注级联。
May 27 博客里写得很直白:"级联是当前开源生态中最灵活的选择,在正确的组件搭配下,它也是最快的。"翻译:端到端虽美,能打的是能拆、能换、能各自优化的级联。
四件套如下:
VAD:Silero VAD v5。 极小、精确、纯 CPU。开源语音 Agent 圈的默认选择。
STT:Parakeet-TDT 0.6B v3。 NVIDIA 出品,流式友好。选 0.6B 而非更大的 Whisper,是质量与延迟之间做了取舍——转录慢 200 毫秒,对话节奏就变了。
LLM:Gemma 4 E4B,llama.cpp 本地推理。 最关键的一环。消费级硬件可跑,Flash Attention 和 sliding window 全缓存压低首 token 延迟。
Marafioti 5 月演示时特意强调:"快到我不得不硬编码延迟来防止它中途打断你说话。"
LLM 后端还支持 MLX(Apple Silicon)、vLLM(多 GPU)、Transformers 直跑、以及任意 OpenAI 兼容接口。
TTS:Qwen3-TTS 12Hz 1.7B CustomVoice。 阿里通义千问团队的模型。表达力强、低延迟、多语言。Linux CUDA 跑 GGML,macOS 走 mlx-audio 6bit 量化。
这套组合拳的关键词不是"最强",而是"每环达标且可替换"。Parakeet 换 Whisper?行。Gemma 换 Qwen3?行。Qwen3-TTS 换 Kokoro?也行。
选择权交给了开发者。
连 Cerebras 也上了桌
7 月 1 日,Hugging Face 与 Cerebras 联合发布博客,将 Gemma 4 31B 接入同一管线。
Cerebras 解决的是 LLM 推理延迟。博客里写道:"某些生产系统中,中位数延迟可以接受,但 P95 仍会出现令人沮丧的多秒等待。"
这层合作的意义不止性能。它表明同一套方案既能在笔记本上跑(Gemma 4 E4B + llama.cpp),也能接到 Cerebras 的高速云端(Gemma 4 31B)。成本和速度按需选择。
"本地免费、云端可选"的弹性,是 GPT-realtime 等封闭方案无法提供的。
Thom Wolf 7 月 3 日的推文不是营销话术。217 次转发、2101 个赞背后,是联合创始人对这个技术栈真实水平的公开确认。
LinkedIn 上,同一条帖子 12 小时内收获 213 个互动。一位 ML 工程师评论:"我的周末计划有了——准备在自己的 Reachy Mini 上试试。"
开源语音AI的分水岭
Hugging Face 这次摊牌回答了一个悬而未决的问题:开源语音 AI 到底能不能打。
2024 到 2025 年,语音 AI 的主叙事是"端到端将终结级联"。GPT-4o Advanced Voice 确实惊艳,但没解决一个问题:贵,且不可控。
Reachy Mini 的 9000 台部署提供了反例。当真实产品的用户量堆上去,成本不是锦上添花的优化,而是生存问题。
开源语音方案在 2026 年上半年明显加速。AssemblyAI 推出 Universal-3 Pro,Hugging Face 上线 FFASR Leaderboard。整个生态快速成熟。
Marafioti 那句"Free on your laptop"不是夸张。pip install speech-to-speech && speech-to-speech,音频不离开本地,零 API 费用,组件透明可换。
两年前这可能被当极客玩具。今天 9000 台机器人已跑起来的背景下,它变成了一个认真的商业选项。
对 OpenAI 而言,这不是恐慌信号。GPT-realtime 的服务质量和集成便利性仍有优势。
但它给出了定价锚点。当开源方案的边际成本趋近于零,云端语音 API 的溢价空间从哪里来?答案或许是更智能的模型、更自然的对话、企业级 SLA。
但用户已经在问:如果我的机器人只是想聊聊天,为什么要付云计算的钱?
参考链接:
本文由 AREX Agent 基于公开信息自动生成,仅代表编辑判断,不构成投资或采购建议。转载需注明出处。_