AREX Feed Article
MiniMax 放出开源权重音乐模型 Music3,一次生成五分钟完整歌曲
北京时间 8 月 14 日 0 时 09 分(UTC 8 月 13 日 16:09),MiniMax 官方账号 发推发布 MiniMax-Music3,自述定位是「下一代开源权重、生产可用且多功能的音乐模型」(Next-Generation Open-Weights Production-Ready & Versatile Music Model)。推文直接指向 Hugging Face 上的权重仓库 。
按 MiniMax 在 中的说明,这个模型一次生成最长五分钟的完整歌曲,输出 32 kHz、16-bit 立体声 WAV。截至本文核对时,发布推文已有 1,761 个赞、240 次转发、122 条引用推文、1,006 次收藏,浏览约 9.9 万次。
歌词带小节标签,一段结构化描述定下整首歌
模型吃两个输入:歌词和音乐描述。歌词里可以用 [Intro]、[Verse]、[Pre-Chorus]、[Chorus]、[Bridge]、[Instrumental]、[Outro] 等小节标签直接规定歌曲结构;音乐描述建议写成三段式——Global Metadata(流派、BPM、调式、情绪走向、聆听场景)、Vocal Details(声线、演唱风格、和声、人声效果)、Arrangement(乐器、律动、低音、打击乐、空间效果)。
架构是分层自回归:8B 的 Global LLM 负责长程音乐结构,逐帧预测第一个 RVQ 码本,参数由 Qwen3-8B 初始化;0.6B 的 Local LLM 补全同一帧内的其余声学码本。两级 LLM 的隐藏状态融合后,经 2.4B 的 Flow Matching 模块进入 Flow-VAE 隐空间,再由 123M 解码器还原成 32 kHz 立体声。Flow-VAE 从 MiniMax 的语音模型改造而来。训练用八层残差矢量量化(RVQ),语义码本 16,384 个条目,七个声学码本各 1,024 个条目。
据 统计,MiniMax 的 放了 26 首示例,覆盖流行、摇滚、R&B、嘻哈、舞曲、乡村、灵魂乐、放克、蓝调、bossa nova、都市音乐 11 个流派,每首都附完整的三段式 caption 供对照。
Hugging Face day 0,ComfyUI 模板就位
发布 21 分钟后,MiniMax 追加一条:「感谢 Hugging Face 团队 @multimodalart,对开源权重音乐模型的 day 0 支持。」
ComfyUI 侧也已经就位。同一份教程显示,模板库里提供现成的「MiniMax Music 3 Text to Music」工作流,转换好的检查点放在 :除 fp16 主干外还有 INT8 版本,并支持分块解码(tiled_decode)给低显存显卡省内存。
模板默认生成 60 秒,最长约 300 秒,更长的歌吃更多时间和显存。
仓库还带一个 music-caption-rewriter 技能,把一句简短描述扩写成 Music 3 的结构化 caption,安装命令是 npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter。
Suno 公布限额细则三天后,社区开始搬家
时机正好接在 Suno 收紧政策之后。,Suno 从 9 月 3 日起对用户曲库中的全部歌曲实行下载限额:免费用户终身 7 次,8 美元/月的 Pro 每月 20 次,24 美元/月的 Premier 每月 60 次。
限额源于去年与华纳音乐集团的版权和解;Udio 在与环球的诉讼和解后已完全关闭下载,Suno 上月还被德国法院裁定违反美、德版权法。
X 上的反应把两件事直接连了起来。用 DGX Spark 跑本地 AI 的开发者 写道:「就在 Suno 用新政策惹毛整个行业的第二天?!这简直是个 game changer,我已经玩过了,效果很好(it's GOOD),而且能塞进一台 DGX Spark。正在下载。」洛杉矶的 AI 艺术家、ComfyUI 专业用户 说:「这太重磅了。开源音乐模型!要是它能接近 H3 视频模型的水准,会很炸裂。」
也有保留意见。X 用户 听完官方演示后写道:「根据 MiniMax 提供的 demo,这个新模型听起来不算特别惊艳,但我很想自己试试,也想看看别人会做出什么。开源 AI 音乐正在稳步走向前沿水准。」
从闭源 API 到开源权重,音乐线换了走法
MiniMax 上一代音乐模型走的是闭源 API。据第三方模型目录 ,Music 2.6 今年 4 月 10 日上线,标注为闭源,不支持自托管和微调,按次计费 0.18 美元/首。Music3 一发布就把权重放上 Hugging Face,这条音乐线换了走法。
这也是 MiniMax 最近连续开源动作的延续:7 月 31 日发布视频模型 H3 时,就预告将开放权重;8 月 9 日它在 里写下「YES WE WILL KEEP OPEN UNTIL AGI ARRIVES」,并称版权问题落定后会考虑转 Apache-2.0。Music3 目前的许可据 ComfyUI 文档名为「MiniMax-Music3 Community License」,条款文件随权重一起放在 Hugging Face 仓库。
「生产可用」目前是双卡工作站的事
文档同时列明边界:模型经 SGLang-Omni 推理,需要两块 CUDA GPU,GPU 0 跑 Qwen3 与八码本 RVQ 自回归生成,GPU 1 跑 Flow Matching 与波形解码;目前只支持非流式生成;文本提示上限 5,000 token;音频生成上限 9,000 个声学帧。
文档最后一节还写明:小节标签和音乐描述提供的是生成式控制,不是严格的符号保证,生成结果的 tempo、调性、配器、歌词和歌曲结构都可能与要求不完全一致。这是 MiniMax 自己写进文档的边界,也是评估「Production-Ready」时最该先读的一行。