AREX Feed Article
Fish Audio 发布 S2.1 Pro 语音模型并宣布 5200 万美元种子轮融资,挑战 ElevenLabs 定价体系
7 月 28 日,AI 语音初创公司 Fish Audio(注册名 Hanabi AI Inc.)公开宣布完成 5200 万美元种子轮融资,同时正式发布其旗舰语音模型 S2.1 Pro。该公司宣称在盲测中以 6/10 胜率击败 ElevenLabs、以 8/10 胜率击败 OpenAI 语音服务,且 API 定价仅为 ElevenLabs 的约六分之一。发布 24 小时内,其官方推文在 X 平台获得超过 450 万次浏览。
融资与背景
本轮融资由 Coreline Ventures 和 Capital Today 联合领投,参投方包括 359 Capital、Play Time、HF0、645 Ventures、Parable、Carya Venture Partners、Alphalist Partners 及多位未披露的天使投资人。公司未公布估值。
Fish Audio 由前 NVIDIA 视频研究员廖世嘉(Shijia Liao)与 CEO Rissa Cao 联合创立,总部位于 Palo Alto。起源颇具故事性:廖世嘉因不满早期合成语音的机械感,在卧室中使用单张游戏 GPU 开始训练语音模型。其开源项目 Fish Speech 在 GitHub 累计获得超过 31,000 星标,随后发展为商业平台。公司成立仅一年即实现 2100 万美元年经常性收入(ARR)和超过 800 万用户。
S2.1 Pro 核心能力
- 5 秒声音克隆:从 5 秒音频样本中克隆声音,克隆过程不超过 15 秒。
- 83 种语言:单一模型覆盖英、中、日、韩、西、阿、法、德、葡、俄等语言,无需切换模型。
- 词级情感标签控制:支持超过 15,000 个自然语言提示词,可在文本中插入
[whisper]、[sigh]、[laughing nervously]等标签,精确控制语调、情感和节奏。 - 低延迟:单次请求首音延迟约 70 毫秒,标准 API 约 90 毫秒,适用于实时语音代理场景。
- 吞吐量:据 AlphaSignal 报道,达 56.3 字符/秒,高于 GPT-Realtime-2 和 Gemini 3.1 Flash TTS。
定价与竞争策略
Fish Audio 的定价为每百万字符 15 美元。相比之下,ElevenLabs 的价格区间为每百万字符 60 至 165 美元,这意味着 Fish Audio 的价格约为其 1/6 至 1/11。公司同时在官方推文中做出极端承诺:如果无法将企业客户的语音 AI 成本削减至少 50%,则提供一年免费服务。
S2.1 Pro 通过 API 免费提供服务直至 2026 年 8 月 31 日(无硬性字符数上限,受合理使用政策约束)。企业客户包括 HeyGen、LiveKit、Retell、Sanas、OpenArt 等,并支持 HIPAA 合规的本地部署。
盲测结果及其局限性
Fish Audio 在其官方博客中公开了盲测方法论:该测试于 2026 年 3 月 26 日至 4 月 5 日在其自有平台上进行,持续 10 天,收集超过 5,000 对偏好数据。测试采用 Bradley-Terry 模型计算得分,以用户"播放后下载"作为行为偏好信号。结果显示,Fish Audio S2 Pro 以 BT 得分 3.07 排名第一,其后依次为 ElevenLabs V3(1.80)、ElevenLabs Multilingual V2(1.35)和 ElevenLabs 2.5 Flash(1.00)。
需要审慎看待以下几点:
- 盲测在 Fish Audio 自有平台进行,非独立第三方测试,目前缺乏外部复验。
- 约 30% 的参与者为 Fish Audio 老用户,可能引入平台熟悉度偏差。
- 各竞品对情感标签的支持程度不一——例如 Inworld、ElevenLabs Flash 仅接收无标签纯文本,测试条件并不完全对等。
- 公司自行承认其 MiniMax API 集成可能未达最优,该模型得分异常低后提前终止测试。
截至发稿时,ElevenLabs 尚未公开回应 Fish Audio 的盲测声明或定价挑战。
社区反应
发布后,Fish Audio 官方推文获得了 7400 余次转发、超过 1 万次点赞和近 9200 次收藏。KOL 账号 @EXM7777 的测评推文也获得超过 100 万次浏览和 5200 余次点赞,称"ElevenLabs 创始人现在应该紧张了"。社区讨论中,部分用户对"开放权重"的实际含义提出质疑,指出模型许可证仅限研究用途、不允许商业使用;另有用户反映模型需要较高 GPU 配置才能在本地运行。
后续计划
Fish Audio 计划将本轮融资用于三方面:(1)扩展模型矩阵,从文字转语音拓展至语音原生大语言模型和实时语音到语音翻译;(2)通过 LiveKit、Retell AI 等合作伙伴深化开发者集成;(3)组建企业销售团队,推动从创作者和开发者群体向大客户市场延伸。