AREX Feed Article
把 782M 参数塞进 415MB:Fermion 开源语音转写模型 Phonon-1
8 月 28 日,Manan Gupta(X 账号 @yoitsmanan,简介自称 "Building @fermion_ai")在 X 上宣布开源英语语音转写模型 Phonon-1:782M 参数、415 MB 下载体积、Apache 2.0 开放权重。称它比两倍体量的 Whisper 更准确("more accurate than a Whisper 2x its size"),在 MacBook Air 上约两分钟转写 1 小时音频。同一天,权重与模型卡上线 ,代码开源至 ——GitHub API 显示该仓库创建于当天 14:28 UTC,许可证为 Apache-2.0。
这些性能数字目前全部出自 Fermion 的自测(模型卡注明了测量口径),还没有第三方独立复测。可以独立核验的,是权重、模型卡、pip 包与代码仓库这些发布物本身。
一条推文串起三样产物:权重页、仓库与研究页
主推文发布于 UTC 17 时 22 分。Gupta 随后在同一条推文串里又发了五条:,decoder 按每权重 2.4 bits 训练(全精度为 16 bits);;并列出模型页、pip 包、Docker 镜像、GitHub 与研究博客的链接。
三样产物都能独立核验。GitHub 仓库当日 14:28 UTC 创建,傍晚 18:52 仍有提交(提交信息 "Phonon-1",署名 Fermion Research),截至当天傍晚核验时 star 与 fork 均为 0。的 datePublished 同为 2026-08-28;(0.1.19)已可安装。
Fermion 是今年 7 月才公开亮相的实验室:7 月 24 日创建,(三个开放权重模型、紧凑三元格式,带 CUDA、Apple silicon 与 x86 运行时)。
八库 WER 表:赢 Moonshine,macro 输给 teacher 与 Parakeet
模型卡给出 8 个语料库(LibriSpeech、TED-LIUM、SPGISpeech、VoxPopuli、GigaSpeech、Earnings-22、AMI)的词错误率(WER,越低越好)对比,对手包括 Parakeet-0.6B 4-bit(637 MB)、Moonshine base(248 MB)、Whisper small(967 MB)与 large-v3-turbo(1,619 MB)、wav2vec2-large,以及它训练所自的 Qwen3-ASR teacher(1,569 MB)。
按八库 macro 平均,Phonon-1 为 7.67,明显低于 Moonshine base 的 10.1,但高于 Parakeet-0.6B 4-bit 的 6.62 与 teacher 的 6.63。总体平均上它没有超过老师和 Parakeet,卖点是"每个字节的准确率"。
推文里"比两倍体量的 Whisper 更准",对应的是 967 MB 的 Whisper small:LibriSpeech test-clean 上 Phonon-1 2.640 对 3.4†,test-other 上 5.699 对 7.6†,均领先。但 Whisper small 只有这两行数据,且都是 † 标注的外部已发表数字。
口径要留意:模型卡注明,无 † 的行是 Fermion 自己的 harness(完整测试集、Whisper 英文归一化、greedy 解码)跑出来的;† 则是从模型卡、论文或 Open ASR Leaderboard 拼接的已发表值。跨口径比较时,领先幅度不宜直接照单全收。
2.4 bits/weight:从训练一开始就压低比特
Phonon-1 的压缩方式不是事后量化。模型卡写明它"从训练一开始就按 2.4 bits per weight 训练";研究页给出口径:相对 teacher,Phonon-1 用 29% 的字节保住 96.7% 到 99.6% 的字准确率,词错误大约多五分之一。
基座是 Qwen 的 Qwen3-ASR-0.6B(Apache-2.0),模型卡称它是"实验室低比特路线上继 Neutrino-1 之后的第二个模型"。
训练语料全部来自宽松许可的英语语音库:LibriSpeech、MLS、Libriheavy、Mozilla Common Voice、NVIDIA Granary 的英语 YODAS 子集、VoxPopuli 与 AMI 会议语料,以 CC-BY-4.0 和 CC0 为主,模型卡要求再分发时保留署名声明。模型只转写英语 16 kHz 音频,输出自带标点与大小写。
低比特是这条路线的一贯主张。研究页把 Phonon-1 与 7 月 27 日的 "Intelligence at one-eighth the bits" 并列展示,那篇自述称一次性二比特转换"接近随机水平",而直接在约束内训练可把 72.1 MMLU 塞进 3.88 GB 的产物。
中位 23.9× 实时:速度数字与三种跑法
速度上,模型卡与研究页给的是"中位 23.9× 实时"(九个语料库、base M5 MacBook Air),也就是 1 小时音频约 2.5 分钟,比推文里"约两分钟"的说法略慢。实时听写场景:中位单句 262 ms,95% 的句子在 629 ms 内完成,家族最快的构建中位 203 ms;流式解码与批量解码在 400/400 句上逐字节一致。
跑法有三种。pip install fermion-research 之后,fermion transcribe 转写文件,fermion listen 实时收音,fermion serve 起一个 OpenAI 兼容的 HTTP 服务,可以用 curl 直接调 http://127.0.0.1:8000/v1/audio/transcriptions。同一份权重在 Apple silicon 上走 MLX,在 NVIDIA GPU 上走 CUDA,Docker 镜像 ghcr.io/fermionresearch/phonon-cuda:latest 已发布。
体积:Phonon-1 下载 415 MB、落盘 455 MB;Micro 285 MB、落盘 331 MB,LibriSpeech test-clean 3.002%、八库 macro 8.52。
有人喊 "Deleting parakeet",有人问 "Chart Crimes?"
发布一个多小时后,主推文约 80 个赞、近 2800 次浏览。Bengaluru 的开发者 回复说本地推理对语音转写的重要性被低估,"Deleting parakeet and shifting to phonon",表示要把 NVIDIA 的 Parakeet 换成 Phonon。Markov Labs(YC S26)联创 引用推文称,Gupta 在"少得荒唐的算力"上做出这些成绩。开发者 说自己约两周前预览过该模型,"同尺寸里最好的语音模型之一"。
也有质疑。播客 ThursDAI 主播、4.2 万关注者的 只回了一句 "Chart Crimes report?",对图表呈现提出质疑。这与模型卡自注的口径问题(自测数字、† 拼接、跨 harness 比较)对应。
Fermion 官方账号则在里给出下一步:未来几天发布一个完全本地运行、由 Phonon 驱动的听写(dictation)应用。
自测的性能,等社区复测
把事实和声明分开看:发布真实发生,权重可下载、代码可 clone、pip 可安装,仓库创建时间与许可证都能对上;"比 Whisper 更准""保住 99% 的 teacher 准确率"则全部出自 Fermion 自己的 harness,模型卡甚至自己标注了哪些对比数字是外部已发表值。
对一个发布当天 0 star 起步的仓库,社区用同一套语料复测 WER、把 MLX 与 CUDA 两条路径各自跑通,是下一个可以核实的节点。在那之前,Phonon-1 的可核实成就是发布本身,而不是"最准"。