AREX Feed Article
Fish Audio 宣布 5200 万美元种子轮,发布 S2.1 Pro,以激进定价向 ElevenLabs 发起挑战
7 月 28 日,语音 AI 初创公司 Fish Audio 在 X 平台宣布完成 5200 万美元种子轮融资,并同步公开发布其旗舰文本转语音模型 S2.1 Pro。发布帖三天内累计浏览超 588 万次、转发 8300 余次、获赞超 1.3 万,成为本周 AI 产品发布中传播最广的事件之一。
一家从单张 4090 起步的公司
Fish Audio 的前身是前 NVIDIA 视频研究员 Shijia Liao(首席科学家)在卧室用一张 RTX 4090 训练的语音合成开源项目 Fish Speech。该项目在 GitHub 上累计获得超过 31,000 星标,吸引了游戏开发者、VTuber 粉丝和独立创作者社区。CEO 兼联合创始人 Rissa Cao 此前曾在 Amazon Alexa 和 Meta 从事语音 AI 工作。
公司在过去 12 个月内从 3 人团队扩张至 22 人,用户数从零增长至超过 800 万,年经常性收入(ARR)达约 2100 万美元。Cao 在公司博客中称,企业客户与开发者合计贡献了公司三分之二的收入。
本轮融资由 Coreline Ventures 与 Capital Today 联合领投,参投方包括 359 Capital、Play Time、HF0、645 Ventures、Parable、Carya Venture Partners 和 Alphaist Partners。以"种子轮"标签融资 5200 万美元,同时已有八位数经常性收入,反映出语音 AI 从产品功能升级为基础设施的速度。
S2.1 Pro:5 秒克隆、83 种语言、词级情绪控制
S2.1 Pro 是 Fish Audio 的核心商用模型,公司宣称其具备以下能力:
- 5 秒声音克隆:仅需 5 秒参考音频即可在约 15 秒内克隆一个声音;
- 83 种语言支持,公司称在口音英语、中文、日语、韩语和西班牙语上表现尤为突出;
- 词级控制:支持超过 15,000 种自然语言标签,可在词级别调节情绪、语调、节奏等;
- 推理速度:在单张 H200 GPU 上达到 8000+ tokens/秒,首音频延迟约 70 毫秒。
公司在盲听测试中称 S2.1 Pro 获得了 66%–67% 的听众偏好率,优于主流竞品。但需注意,截至发稿,尚无独立第三方基准测试对这些性能与成本声明进行系统验证。
价格战:成本约为 ElevenLabs 的六分之一
Fish Audio 的定价策略极为激进。S2.1 Pro 的 API 价格为每百万字符 15 美元,而 ElevenLabs 同类服务的价格区间为每百万字符 60–165 美元。公司还声称速度比 Cartesia 快 2 倍。
更具冲击力的是,Fish Audio 在发布帖中做出了书面承诺:若不能为企业客户降低 50% 的语音 AI 成本,将免费提供一年服务。
为庆祝一周年,S2.1 Pro 在 2026 年 8 月 31 日前通过 API 免费向所有开发者开放。公司将其归功于推理栈的重构——包括自研 FP8 GPU 内核库,使单次请求成本大幅下降。
企业客户与商业模式
Fish Audio 采用"开源引流、API 变现"的商业模式:开源模型(S2 权重已于 2026 年 3 月发布)积累开发者社区,S2.1 Pro 则通过付费 API 为企业提供延迟保障和正常运行时间承诺。已公开的企业客户包括 HeyGen、LiveKit、Retell、Sanas 和 OpenArt。公司还支持本地部署、零数据留存策略和 HIPAA 合规配置。
语音克隆的滥用争议
5 秒克隆能力也引发了关于语音伪造风险的广泛讨论。在 Instagram 等平台上,大量用户一边展示克隆效果,一边标注"请勿滥用",侧面反映公众对这一技术的警惕。
早在 2026 年初,Fish Audio 就因社区语音库中未经授权上传的声音而受到创作者投诉。2026 年 7 月 4 日,公司上线了专门的语音所有权争议流程——权利方可通过模型页面提交政府 ID 或企业授权并朗读验证句,公司声称移除操作可在三分钟内完成。Coreline Ventures 管理合伙人 Osuke Honda 也在投资声明中强调:"同意、透明和归因必须嵌入产品,而非事后补救。"
下一步:语音理解与语音到语音
Fish Audio 明确表示文本转语音只是起点。公司路线图包括年内发布的音频理解语言模型(Audio LM),以及仍在开发中的语音到语音(speech-to-speech)模型,目标从单向旁白扩展至语音代理栈的完整覆盖。