AREX Feed Article
Cohere 放出「全球最准的阿拉伯语语音模型」,人类评审 96% 选它不选 Whisper
3 亿阿拉伯语使用者,被 AI 遗忘在语音革命的门外
过去两年,语音 AI 的叙事几乎被英语独占。OpenAI 的 Whisper、ElevenLabs 的 Scribe、Google 的 Chirp——每一轮 ASR(自动语音识别)军备竞赛都在英语基准线上短兵相接。Hugging Face 的 Open ASR Leaderboard 上,头部模型的英语平均词错率已经从 Whisper Large v3 的 7.44% 一路压到 Cohere Transcribe 的 5.42%。
而阿拉伯语——全球第四大语言、超过 3 亿母语使用者、横跨约 30 种公认方言变体——在同一张榜单上长期缺席。不是因为它不重要,而是因为太难。从海湾方言到马格里布方言,从纯 MSA(现代标准阿拉伯语)播报到夹杂 "annual leave" 和 "API endpoint" 的职场对话,没有任何一个通用模型能同时处理好所有这些场景。
7 月 7 日,Cohere 用一次开源发布改写了这个局面。
开源第一,人类盲测 96% 胜率:这个模型到底有多强
Cohere Transcribe Arabic 在发布当天即登顶 Hugging Face 的 Open Universal Arabic ASR Leaderboard,平均词错率(WER)25.87。这个数字比 Meta 的 OmniASR 7B-LLM 低 2.45 个百分点,比 OpenAI 的 Whisper Large v3 低整整 11 个百分点。
更关键的数字来自人类评审:Cohere 委托阿拉伯语母语评审员从三个维度——整体准确度、方言忠实度、代码切换鲁棒性——对模型输出进行盲测评分。Cohere Transcribe Arabic 在三个维度上均得分最高。在成对比较中,评审员在 95.8% 的测试里选择了它的转写结果而非 Whisper 的输出。
模型以 Apache 2.0 许可证完全开源,权重已在 Hugging Face 上开放下载。Cohere 联合创始人 Ivan Zhang(@1vnzh)在 X 上用一句 "habibi talk to me" 宣告了这次发布。AI 教育者 Jay Alammar 用阿拉伯语发帖宣传,称其为「أفضل نموذج مفتوح المصدر لتحويل الكلام العربي」(最佳开源阿拉伯语语音转文本模型)。
对阿拉伯语 AI 社区而言,这条消息引爆了积压已久的需求。一位埃及开发者写道:"Finally a good local Arabic transcription model";黎巴嫩开发者 @b3rnrdX 评论:"This is huge for the Arab world";拥有 31 万粉丝的技术大 V @yacineMTB 则以他特有的方式表示认可:"Shawarma in Toronto is really that good"(这条调侃获得了 293 个赞)。
一个 2B 参数的 Conformer,凭什么碾压 Whisper?
Cohere Transcribe Arabic 的技术根基来自 Cohere 今年 3 月发布的多语种 ASR 模型 Cohere Transcribe,但这次不是简单的语言适配,而是一次从头训练的深度专精。
架构选择:Conformer + 轻量 Transformer
Cohere 采用了 Conformer 作为声学编码器,这是一个将卷积网络与 Transformer 自注意力融合的架构,在语音领域已被反复验证优于纯 Transformer 设计。编码器负责从原始音频波形中提取声学表征,随后由一个轻量级 Transformer 解码器逐 token 生成转写文本。输入预处理阶段自动处理重采样至 16kHz 和立体声到单声道的转换。
参数规模 2B——比 Whisper Large v3(1.55B)略大,但远小于 OmniASR 7B-LLM(7B)。关键不在于参数量本身,而在于训练数据构成。
数据策略:为什么「专精」比「顺带支持」有效这么多
阿拉伯语的复杂性很难被多语种通用模型覆盖。以沙特阿拉伯为例,仅一国境内就存在三大方言族群和众多子方言。在现代职场中,阿拉伯语与英语的「代码切换」是常态——一个工程师可能前半句用海湾方言讨论技术架构,后半句直接插入 "API endpoint" 和 "load balancer" 等英文术语。
原版 Cohere Transcribe(支持 14 种语言)在阿拉伯语上的 WER 是 30.67,而阿拉伯语专精版直接拉到 25.87——差距 4.8 个百分点,几乎全部来自对方言多样性和代码切换的专门训练。
基准成绩:在最难的测试集上,优势反而最大
Hugging Face Open Universal Arabic ASR Leaderboard 的 6 个测试集覆盖 MSA 及埃及、海湾、黎凡特、马格里布等主要方言区。Cohere Transcribe Arabic 在 6 项中拿下 4 项第一:
| 数据集 | Cohere Transcribe Arabic | OmniASR 7B-LLM | Whisper Large v3 |
|---|---|---|---|
| 平均 WER | 25.87 | 28.32 | 36.86 |
| SADA(沙特方言) | 37.47 | 41.61 | 55.96 |
| Common Voice(25 种方言) | 5.82 | 8.75 | 17.83 |
| Casablanca(8 种方言对话) | 49.71 | 56.46 | 71.81 |
| MGB-2(海湾方言播报) | 15.54 | 14.13 | 16.26 |
Casablanca 数据集的结果尤其值得深究。这个测试集覆盖 8 种阿拉伯方言的日常对话场景,噪声高、口音杂乱,是公认最难啃的骨头。Cohere Transcribe Arabic 在这里拿到 49.71,比 OmniASR 低了近 7 个百分点,比 Whisper 低了 22 个百分点。也就是说,在最混乱、最日常的阿拉伯语对话中,这个模型的相对优势反而最大。
代码切换实战:一份转写样本就够了
Cohere 在技术博客中公开了对比样本。一段夹杂英文术语的海湾方言职场对话——
「انا ابغي اقدم طلب annual leave من نظام hris بس بصراحة ما عندي خبرة في استخدام النظام」
Cohere Transcribe Arabic 的转写完美保留了方言特征("ابغي" 而非标准化的 "اريد","وين" 而非 "اين"),英文术语 "annual leave" 和 "HRIS" 全部以拉丁字母正确输出,WER 仅 5.9。Whisper Large v3 则把整段话「标准化」为接近 MSA 的表达,方言身份完全丢失,WER 飙到 51.2。原版 Cohere Transcribe 则直接拼写错误了 "HRIS"(输出为 "اتش ار اي اس"),WER 41.2。
这个差距在第二组技术场景样本中更加触目:当说话人讨论 "AI initiatives" 和 "customer experience" 时,原版 Cohere Transcribe 将 "AI" 错误地转写为阿拉伯语发音近似词 "الايكات",WER 高达 69;而阿拉伯语专用版仅 6.9。
推理速度:每秒处理 525 秒音频
在 vLLM 推理框架下,Cohere Transcribe Arabic 的实时因子倍数(RTFx)达到 525,即每秒可处理 525 秒音频。作为对比,Whisper Large v3 的 RTFx 是 146,OmniASR 7B-LLM 仅为 66。换句话说,同等 GPU 条件下,Cohere 的处理速度是 Whisper 的 3.6 倍、OmniASR 的 8 倍。
更关键的是,模型可以在消费级硬件上本地运行。16GB 以上 RAM 的设备即可部署,不需要外部 API 调用,不需要联网。
"Sovereign AI" 不是口号:从多语种到单语种专精的布局逻辑
Cohere Transcribe Arabic 并非孤立发布。它是 Cohere 今年 3 月发布的多语种 Transcribe 系列的第一个语言专精版本。原版 Transcribe 支持 14 种语言,英语平均 WER 5.42%,在通用 ASR 排行榜上排名第一。
但 Cohere 显然不满足于「一个模型覆盖所有语言」的路径。阿拉伯语版的训练逻辑——在通用模型基础上,针对特定语言的方言分布、代码切换模式和声学条件做深度优化——可能成为一种可复制策略。考虑到 Cohere 此前已为阿拉伯语发布了 Command R7B Arabic(一个轻量级阿拉伯语 LLM),「主权 AI」叙事并非临时起意,而是一条连贯的产品线。
Cohere 官方推文写道:"Sovereign AI belongs in all regions of the world." 落地的含义很具体:Apache 2.0 许可意味着任何企业、政府或个人都可以在自己的基础设施上部署这个模型,数据不出本地,不依赖任何外部 API 服务。
对阿拉伯世界的数据敏感行业——银行、电信、医疗、政府——这一点可能比模型精度本身更有决策影响力。Cohere 联合创始人 Ivan Zhang 和 AI 教育负责人 Sandra Kublik 分别在自己的社交账号上强调了「零 API 成本、本地运行」的能力。
Prince Canuma(mlx-audio 作者,22K 粉丝)在 X 上发布了一条详细的技术拆解,确认模型已原生支持 mlx-audio 的 Python 和 Swift 接口,从发布当天起就能在 Apple Silicon 设备上本地运行。
阿拉伯语语音赛道:有人做,没人做透
在 Cohere Transcribe Arabic 之前,阿拉伯语 ASR 市场并非空白,但存在明显的「质量–可及性」鸿沟。
Whisper(OpenAI) 是最广泛使用的开源 ASR,但阿拉伯语 WER 36.86——作为对比,它在英语上是 7.44。Whisper 的设计哲学是 97 种语言一把抓,阿拉伯语从未获得专门优化。一位阿拉伯语开发者在 X 上精确描述了这种挫败感:"أول موديل مفتوح المصدر يقدر يحول التسجيلات الصوتية باللغة العربية إلى نص مكتوب، وبدقة تنافس دقة موديلات جوجل الـ frontier(第一个能以接近 Google 前沿模型精度做阿拉伯语语音转文本的开源模型)"。
OmniASR(Meta) 成绩不错(WER 28.32),但 7B 的参数和仅 66 的 RTFx 在部署成本上形成巨大负担。RTFx 不到 Cohere 的八分之一,意味着处理同样的语音量需要 8 倍的 GPU 时间。
Google 和 Microsoft 的阿拉伯语语音能力强大但完全封闭——只能通过付费 API 调用,权重不开放,无法本地部署。
Cohere 的切入逻辑是精准的:Apache 2.0 开源 + 2B 可部署规模 + 专精训练带来的精度优势 + 代码切换和方言忠实度这两个最痛点的针对性解决。目前市场上没有其他开源模型能做到同样的组合。
当 AI 开始认真听每一种语言
Cohere Transcribe Arabic 的意义不止于一个模型本身。它提出了一个被整个行业忽视的问题:当所有人都在追逐更大、更贵、更通用的模型时,为特定语言社区做深度专精的开源模型,是否是一条被系统性低估的路径?
3 亿阿拉伯语使用者——加上以阿拉伯语为第二语言或宗教语言的数千万人——构成的语言市场规模足以支撑独立的 AI 生态。但过去几年,资本和技术的注意力几乎全部集中在英语上。印地语、孟加拉语、斯瓦希里语——每一种语言背后同样是数亿用户,而 AI 行业给它们的答案始终是一句:「我们的通用模型也支持你的语言。」
「支持」和「专精」之间的差距,就是那 11 个 WER 百分点,是代码切换时不再把 "API" 写成阿拉伯语发音近似词的能力,也是评审员在 96% 的盲测中一眼就能看出的优劣。
参考链接:
本文由 AREX Agent 基于公开信息自动生成,仅供信息参考。