AREX Feed Article
Pika 杀进音频赛道:四款模型上线,自称比同行便宜最多 20 倍
8 月 14 日,Pika 在宣布推出公司首个音频基础模型家族 Pika Audio Models:Pika Soundtrack 把视频变成同步配乐,Pika Music 把 prompt、歌词、人声和参考曲目变成完整歌曲,Pika SFX 把文字指令变成音效,Pika Speech 把文字变成带音色克隆的语音。四款模型即刻可用,只通过 独家提供。
Pika 给这套模型的核心卖点是价格。博客副标题直接写 The lowest prices on the market,正文称最高比其他音频模型便宜 20 倍,并点名 Pika Speech 的成本效益是 ElevenLabs v3 的 9 倍。这些倍数全部出自 Pika 自己的基准测试,按 2026 年 8 月 14 日的官方标价计算,未经独立验证。
49 秒视频配完音,Meng To 说一共花了 2 美分
设计教育平台 designcode.io 创始人 Meng To 说,他让 Codex 通过 MCP 调用 Pika Soundtrack,给一段 49 秒的视频配出音乐和音效,"整个音频环节花了 0.02 美元"。他还说自己一直在给网站的落地页加声音,"对体验加分很多"。
拥有约 38 万关注者的 AI 创作者 Min Choi ,配文搬出 Will Smith 吃意面的梗,写"AI 在三年之后修好了它",结尾一句:"RIP silent AI videos"(无声 AI 视频安息吧)。
LobeHub 增长负责人 Max For AI 在里把四款模型单价逐一列出,特意抄下 Pika 公告推文那句"20 倍便宜。字面意义上,没有免责声明",评论"多少有点生怕大家以为它在玩营销数字"。
AI 艺术创作者 Andrew Krivulya ,Soundtrack 加的沙地音效和打在木牌上的枪声"比预想更接近真实拟音",不过"混音有点 gated,小毛病"。
API Club 上线第十天,Pika 补上声音缺口
Pika Audio Models 发布时,Pika API Club 开张刚满十天。8 月 4 日,Pika 上线 Pika API Club,一个会员制 API 平台。它当时的说法是,被"很多 API 聚合平台 3 倍的加价"震惊,于是自建平台,把抽成压到最低。
随后两天,(比聚合平台低最多 50%)和 (低最多 88%)先后挂上平台,Pika 强调"这不是临时折扣,就是我们的定价"。
但在音频上线前,Pika 自家模型全是视频和图像方向。现在列出的自家模型是 Pika 2.5、Pikadditions、Pikaswaps、Pikaffects、Pika 2.5 Keyframe 五款,没有声音;博客也把这套音频模型称作公司"首个音频基础模型家族"。
科技媒体 Eyerys 在 8 月 15 日的里,把 Pika 称为"以文生视频和图像转视频模型闻名的公司"。8 月 14 日上线的这套模型补的正是这块缺口;博客结尾写,它们"只是我们让高质量生成媒体更易得的计划的开始"。
一个 API key 接四种声音,单价从 0.0002 美元起
API Club 的写明,四款模型共用一个 API key 和一致的请求格式。公开单价是:Pika SFX 每秒 0.0002 美元,Pika Soundtrack 每秒 0.005 美元,Pika Speech 每分钟 0.01 美元,Pika Music 每分钟 0.015 美元。
Soundtrack 输入视频,输出同步的配乐、语音、环境声和跟随画面动作的音效;prompt 可以留空,让模型自行配完整段。Pika 称,在其全长基准测试中 Soundtrack 拿到所测模型里最强的语义对齐和最低的音画失步,处理 529 秒视频时每生成 1 秒音频耗时 0.617 秒,对比对象是 LTX-2.3 Foley V2A、HunyuanVideo-Foley 和 MMAudio v2。
Music 把文本 prompt、歌词、人声参考、参考曲目任意组合,生成最长 6 分钟的完整歌曲。Pika 的内部测试里,一首 90 秒的歌平均 6.21 秒生成完,约 14.5 倍于播放速度。
SFX 把自然语言指令变成音效,单条最长 20 秒、44.1 kHz 立体声,本地基准平均 0.847 秒完成端到端生成。
Speech 生成 48 kHz 语音,单次请求最长 5 分钟,实时率 0.02,一分钟语音约一秒钟生成。可选预设音色,或用几秒参考音频克隆音色。日本视频创作者 SEIIIRU 在里观察,Speech 目前完整支持的只有英语和中文,日语似乎尚未正式支持。
ElevenLabs 做起了视频,Pika 开始做音频
价格对比是公告的核心。按 Pika 的算法,称 Pika Soundtrack 比 Hunyuan Foley(它认定的唯一功能可比的视频转音频模型)成本效益高 2 倍;Pika SFX 最高比替代方案成本效益高 20 倍。
Pika Speech 比 ElevenLabs v3 成本效益高 9 倍,比 Cartesia 和 ElevenLabs Turbo 高 4.5 倍,比 Fish Audio 高 2 倍;Pika Music 最高比同类音乐模型成本效益高 10 倍。
对低价的原因,Pika 给出的解释是:高效训练与推理技术、few-step 生成、为速度设计的推理栈,"用少得多的算力生成同样优秀的输出"。数字的边界也写在公告脚注里:所有对比"截至 2026 年 8 月 14 日,基于各模型提供商的官方标价"。20 倍、9 倍这些倍数都出自 Pika 自己的基准测试和标价算术。
Pika 的在 "up to 20x times cheaper" 后面加了一个星号,紧跟一句 "There is literally no disclaimer"(字面意义上,没有免责声明)。而博客正文末尾留着一行关于标价的脚注。
从业者 @xishu_ai 在里写:"ElevenLabs 做了视频业务,Pika 开始做音频了。"
9 倍和 20 倍,都还是 Pika 单方面的账本
四款模型和单价已经落地,Speech 的语言覆盖还被用户试出"英语、中文可用,日语待定"的疑问。9 倍、20 倍这些倍数仍全部基于 8 月 14 日那天的官方标价、出自 Pika 自己的基准测试。Pika Speech 和 ElevenLabs v3 的真实差距,要等有人把两者放进同一份独立评测才算数。