AREX Feed Article
Wispr 完成 2.8 亿美元 B 轮,预告首款自研语音模型 Canto
以 AI 听写工具 Wispr Flow 闻名的初创公司 Wispr,8 月 17 日(周一)宣布完成 2.8 亿美元 B 轮融资,由 Menlo Ventures 领投,估值 20 亿美元,累计融资额升至 3.61 亿美元。与公司给出同一组数字。TechCrunch 还指出,上一轮融资发生在不到 10 个月前。
与融资同步公开的是 Wispr 首款自研语音模型 Canto 的预览:2B 参数,公司称它能把最困难听写条件下的词错误率从 30% 以上降到 5%–10%(TechCrunch 的表述是从 30% 降至 10% 以下)。这些数字均系公司单方声称。
2.8 亿美元怎么分:Menlo 领投,运动员跟投
除领投方 Menlo Ventures 外,老股东 Notable Capital、NEA、Neo Ventures、8VC 与 MVP Ventures 本轮追加投资;新投资者包括 Acrew、Forerunner、Goodwater、Peak XV、Together Fund 与 PLUS Capital(TechCrunch 报道)。公司的名单多了一个 Activate,并补充称,还有一批由艺术家、运动员与文化领袖组成的投资群体参与,包括 Livvy Dunne、Shaun White、Dak Prescott、Joe Burrow、Klay Thompson、Domantas Sabonis 在内的 12 人。
三届 NBA 全明星 Sabonis 在博客里给出使用证言:"我每天用 Flow。我从小在英语、西班牙语和立陶宛语之间切换,无论我说哪种,它都跟得上。"
Kothari 在推文中解释这笔钱的去向:更深入地投入"产品、实验室、模型和团队";博客则写明,本轮最大的一部分将投向准确率研究。
Canto 专为嘈杂房间与混说场景而生
Kothari 在官宣推文里描述 Canto 的训练目标:"人们真正说话的地方:嘈杂的房间、刮风的街道、旁边有学步的孩子、第一语言里混着第二种语言。"他把 Canto 称为"快速推出的一系列模型中的第一款","每一款都会比上一款更大、更强,并且每一款都应在上线当天就让 Flow 的听写变得可以感受到"。
公司博客给出更具体的数字:在背景噪音、风、重口音或音乐等最困难条件下,词错误率从 30% 以上降至 5%–10%;日常使用中,预计需要用户编辑的听写减少 30%–35%。
博客还解释了模型如何应对真实的说话方式:说 Hinglish 的印地语用户期望看到罗马字母转写;模型会调用用户词典和联系人姓名,识别属于用户个人生活的词汇。这些数字全部出自公司自己的表述,没有第三方测试数据佐证。
过去几周,用户抱怨听写质量下滑
TechCrunch 报道,过去几周有多名用户抱怨 Wispr Flow 听写输出质量下滑;同一篇报道称,公司发布 Canto 正是为了提升语音理解质量。这篇报道还列出听写赛道的竞争:Willow、Monologue、Aqua、Superwhisper 等应用,以及一批开发者正在做的免费或低价 prosumer 工具。
官宣推文下的回复里,质疑与祝贺并存。自称 AI 创始人的 Mario Behrendt 写道:"Wispr Flow 大概是 AI 热潮里估值最离谱的一个(peak AI boom valuation insanity)。这么多人在抱怨产品变差了;竞品这么多,很多完全免费还更好;Siri 只差一步就能完全取代它。"
用户 Devraj 的评论更直接:"280 million for an OpenAI Whisper wrapper"——质疑 2.8 亿美元买来的不过是 OpenAI Whisper 的包装。墨尔本用户 InsecureJezza 则说,自己在应用里口述了 25 万词之后取消了订阅,因为 AI 支持机器人在最近的问题上帮不上忙。这些是 X 用户的单方说法,但方向与 TechCrunch 报道的抱怨一致。
Notetaker 上桌,实验室与硬件合作同步铺开
这轮融资不止为听写。TechCrunch 报道,公司刚发布的会议记录工具 Notetaker 正在对打 Granola、Fireflies、Read AI;它目前能显示摘要与行动项,并有与外部工具集成、更新内容或生成文档、邮件草稿的空间。公司博客显示 Notetaker 于 8 月 5 日发布。
Wispr 还与 Oasis 戒指等硬件厂商合作,让用户不必大声也能听写;去年 11 月上线 Android 版,并在印度、英国扩张销售团队。上月成立的 Wispr Advanced Interfaces Lab 由 Ariya Rastrow 领导,公司称他是 Amazon Alexa 早期团队成员、现任首席科学家。
博客给出的规模数据是:用户已用 Flow 写下超过 600 亿个词,几乎覆盖全部 Fortune 500 公司,超过 1 万家企业正在使用。
Canto 上线日期,官宣与报道均未提及
Kothari 在推文中重申了五年前的愿景——让语音成为人与设备交互的主要方式:"一个让人全天依赖、在每个应用里都能用的语音界面,现在还不存在。"
但官宣推文、公司博客和 TechCrunch 报道都没有给出 Canto 的上线时间,也没有给出后续模型的参数规模。博客只说,未来几年公司内部以"零编辑率"作为衡量标准,即第一次就完全正确、不需要任何改动的听写占比。
2.8 亿美元买来的是把 Canto 和后续模型做出来的时间。25 万词后取消订阅的用户会不会回来,取决于"上线当天就能感受到"的改进是否如期兑现。