AREX Feed Article
腾讯混元开源 1.5B 语音基础模型 AuK:MIT 许可,代码与权重同步公开
9 月 9 日,腾讯混元团队在 (tencent/AuK)与 (Tencent-Hunyuan/AuK)同步发布开源公告:语音基础模型 AuK 正式开源,参数量 1.5B,采用 MIT License,代码与模型权重均公开可下载;除基础版外,还提供面向快速推理的蒸馏变体 AuK-Flash,支持 4 步采样。两份页面的 News 条目都标注日期 2026/09/09,README 的措辞是「我们开源了 AuK,代码与模型权重公开可用」,仓库最新提交同样落在 9 月 9 日。
按模型卡与 README 的官方介绍,AuK 是一个用于语音生成与编辑的基础模型,训练使用了数百万小时的多样音频数据,全部任务通过同一套自然语言指令接口完成:零样本与指令式文本转语音(TTS)、内容编辑、声学编辑、副语言编辑、语音增强与分离都被装进同一个模型。发布方同时给出 Hugging Face 与 ModelScope 双平台的权重下载命令和两个在线演示入口。以上能力与数据描述均出自腾讯混元团队发布的材料,属官方自述口径。
(图源:Tencent-Hunyuan/AuK 仓库 README「Performance」一节配图 ,图中的 AuK、AuK-Flash 与 Qwen3-TTS、Seed-TTS、Ming-UniAudio、Step-Audio-EditX、NVIDIA RE-USE 等系统并列比较,数据为发布方自述。)
一套接口管生成与编辑,官方列出 16 项任务
模型卡的 Supported Tasks 表按 5 个类别列出 16 项任务。语音生成类包括零样本 TTS(用参考音频的音色朗读目标文本)和指令式 TTS(只凭一段声音描述生成语音,无需参考音频)。内容编辑类可改写、插入或删除已说出的内容,还能改写演唱录音中的歌词并保留旋律与人声。声学编辑按半音升降调、按系数调语速、按分贝调音量。副语言编辑类可改变情绪、按描述换音色、去除方言口音、删除呼吸声与笑声咳嗽等非语言声,或在正常说话与耳语之间转换。增强与分离类包括降噪去混响、按说话顺序只保留某位说话人、从混音中提取人声,以及按「说了什么」锁定目标说话人。
README 里的命令行示例把这些操作都写成普通句子:去噪指令是 请将这段音频恢复成纯净人声版本:保留原本所有说话人,并去除其中的噪声和混响,输出等长的纯净语音。;内容改写则把改动直接写进指令,比如把 but accepting what we cannot have 换成 and living well with dreams unmet。模型卡称每个任务都配有 Cookbook 小节,提供指令模板及命令行(CLI)、Python 示例。
技术报告披露的架构:多模态语义条件与双流 MMDiT 生成
配套的《AuK Technical Report》已提交 arXiv(编号 ,9 月 8 日提交 v1)。报告称,训练数据包含约 30.3 亿条指令-音频样本、195 万小时有效监督(这是报告所称「有效监督」的口径,与模型卡「数百万小时音频数据」的表述不同),覆盖语音生成、内容编辑、增强与分离、副语言编辑、声学编辑五类任务。
架构上 AuK 由三部分组成:多模态大语言模型提供语义条件,在语音、通用音频与音乐上联合训练的变分自编码器(VAE)提供声学条件,生成部分是一个混合 rectified-flow Transformer,先经双流 MMDiT 块、再经单流 DiT 块处理。训练先从纯生成任务预热,再进入生成与编辑的联合预训练;后训练阶段,开放式编辑使用基于人类反馈的偏好优化,语音生成使用基于奖励的强化学习。
(图源:Tencent-Hunyuan/AuK 仓库 README「Model Architecture」一节配图 。)
模型卡「下载权重」一节补充了运行层面的结构说明:检查点只包含扩散 transformer 与 layer-fusion 权重,MLLM 编码器和 VAE 在运行时从单独文件加载,因此加载时若出现缺失 text_encoder.* 键,模型卡明确说是预期行为。
AuK-Flash:固定 4 步采样、免分类器引导的蒸馏变体
AuK-Flash 走的是与基础版不同的路线。模型卡表格把 AuK-Flash 描述为「面向 4 步快速推理的蒸馏模型」,README 进一步说明它使用 4 个固定时间步,并关闭无分类器引导(classifier-free guidance,即 CFG=0)。技术报告称,蒸馏采用一致性初始化与 task-routed Decoupled DMD,在匹配条件下,AuK-Flash 相对完整模型实现 4.5 倍的实际耗时(wall-clock)加速。以上均为报告自述结果。
两个变体的取舍在 Gradio 界面说明里写得很直白:AuK Base 质量更高,NFE(采样步数)与 CFG 可配置;AuK-Flash 生成更快,固定 NFE=4、CFG=0。命令行切换只需改一个参数:--ckpt ckpts/AuK-Flash/auk_flash.safetensors。
权重之外的另一份下载:Qwen2.5-Omni-3B 编码器
权重在两个平台发布。Hugging Face 侧执行 hf download tencent/AuK(蒸馏版为 tencent/AuK-Flash),ModelScope 侧执行 modelscope download --model Tencent-Hunyuan/AuK(蒸馏版为 Tencent-Hunyuan/AuK-Flash)。README 给出的目录结构把三份内容并列:ckpts/AuK、ckpts/AuK-Flash(可选)与 ckpts/Qwen2.5-Omni-3B。最后一份是 Qwen2.5-Omni-3B 多模态编码器,负责文本与音频编码,需要单独下载;README 同时注明当前实现使用 Qwen2.5-Omni-3B,--qwen_path 暂不支持 Qwen3-Omni。
仓库同步交付:CLI、Gradio、ComfyUI 与微调代码
代码仓库随公告一并提供推理 CLI(auk-infer)、Gradio 界面(auk-gradio)、ComfyUI 节点与微调代码。命令行中 --instruction 必填,参考或源音频按任务可选。可选组件 Prompt Enhancer 把一句自由请求整理成带指令、目标时长与音频预处理的完整命令,它需要 OpenAI 兼容的大模型接口(README 示例为腾讯云 TokenHub);语音识别可走腾讯云接口,未配置凭据时 AuK 会自动下载 iic/SenseVoiceSmall 作为 CPU 后备方案。README 还给出双 GPU 部署示例:AuK 与 AuK-Flash 分别加载到 cuda:0 和 cuda:1,共享同一个 Qwen 编码器目录。
git 历史显示这次开源从建仓到公告约一周:9 月 4 日首批提交(LICENSE、ckpts、scripts 均标注 Initial release),9 月 8 日并入 ComfyUI 集成,9 月 9 日更新 README 与性能配图并对外公告。想先试后跑的用户已有现成入口: 与 (后者挂在 Tencent-Hunyuan 组织下,显示名「腾讯混元」,其说明称界面同时提供 AuK-Flash 与 AuK Base 两个变体)。README 给出的最短上手路径是装好依赖后直接运行 auk-gradio:在标准目录布局下,它会自动检测 ckpts/AuK 与 ckpts/AuK-Flash 两个变体并同时放进界面。