AuK 架构拆解Qwen2.5-Omni 当大脑、Flux2Edit 当画笔扩散 Transformer 怎么统一语音生成与编辑【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK语音技术圈长期存在一个尴尬的碎片化现实要克隆音色你得准备零样本 TTS 模型要改口音得换一套声学编辑管线要去噪分离又得接第三方的增强模型——每个能力一个模型、一套接口、一份部署成本。腾讯混元与上海交大联合开源的 1.5B 语音基础模型 AuKMIT 协议代码与权重全开放试图用一句话终结这种碎片化自然语言指令 参考音频的单一接口统一调度生成、编辑、增强与分离五族共 16 类任务。支撑这一野心的是一套三件套架构Qwen2.5-Omni 多模态语言模型提供语义条件BigVGAN-Flow VAE 提供声学条件与波形重建一个 FLUX 风格的混合流 Transformerconfig 中名为 Flux2Edit负责在两者之间做条件流匹配生成。本文结合仓库源码config.yaml、README.md与技术报告逐层拆解这套大脑—画笔—画布的协作机制。一个接口五族任务AuK 在解决什么问题在进入架构之前先看数据规模这是统一模型成立的前提。AuK 的预训练语料构建了约30.3 亿条指令-音频样本、195 万小时有效监督横跨五大任务族语音生成零样本 TTS 与指令 TTS、内容编辑语音内容增删改、歌词改写、声学编辑语速/音量/音高、副语言编辑情绪、音色、去口音、非言语声、耳语转换以及增强与分离去噪、多说话人分离、音乐分离、目标说话人提取。关键在于这些任务全部收敛到同一个公式——指令 t 加上可选音频上下文 x_ref映射到目标波形。没有参考音频时如 Instruct TTS模型要从一段语音描述里凭空设计音色有参考音频时零样本 TTS、各类编辑参考波形同时喂给两个地方多模态编码器的音频分支以及 VAE 的编码器。一个模型、一套损失、一种条件注入方式这正是统一性的架构前提。系统级视角一条指令如何变成两条条件流AuK 的整体链路是典型的双流条件 → 融合生成设计。技术报告给出了清晰的分工语义流Qwen2.5-Omni 把文本指令必要时连同参考音频编码为语义条件 c_sem声学流AuK-VAE 把参考音频压成声学 latent作为参考条件 c_ac再与加噪的目标 latent z_t 拼接混合 Transformer前 10 层双流 MMDiT 块让语义流与声学流相互交换信息但保留各自残差通路后 20 层单流 DiT 块把融合序列统一精修预测目标 latent 的速度场解码VAE 解码器把预测 latent 还原成 24kHz 波形。这套结构与文本图像生成的 FLUX 一脉相承图像领域的文本条件 图像 latent在这里被替换成语义条件 声学 latent而编辑任务天然需要参考音频这个额外条件双流架构正好为它留出了独立通路。Qwen2.5-Omni-3B指令的大脑与语义条件工厂语义条件由冻结的 Qwen2.5-Omni-3B 产生它扮演的是听懂人话的角色——把自由形式的指令翻译成生成器可用的稠密向量。两个细节决定了这个大脑的特殊之处。第一音频感知能力。零样本 TTS 和所有编辑任务都需要看参考音频。Qwen2.5-Omni 本身带音频编码器因此参考波形会先经其音频编码器转成音频表征再与文本指令一起进入 LLM 主干。有参考音频时隐藏状态来自联合编码无参考音频时仅由指令驱动——同一个编码器覆盖了两种任务形态。第二层间加权聚合。一般做法是取 LLM 最后一层输出做条件但 AuK 认为不同深度的表征携带互补的线索——浅层偏语言、深层偏跨模态对齐。于是它把每一层的隐藏状态都拉出来先过 LayerNorm 平衡尺度再用可学习标量加权求和c_sem Σ_ℓ w_ℓ · LayerNorm(h^(ℓ))w_ℓ 是无约束的可学习参数随主干一起训练。config 中text_hidden_dim: 2048对应的就是投影后的语义向量维度经过P_sem线性投影 RMSNorm后成为 Transformer 的语义流输入。工程上还有个细节值得注意因为编码器在运行时从外部加载README.md 中hf download Qwen/Qwen2.5-Omni-3Bcheckpoint 里不含text_encoder.*权重加载时出现这些 key 缺失属于预期行为config.yaml 的text_encoder_path正是为了在推理时定位它。Flux2Edit条件流匹配的画笔生成主干在 config.yaml 中直接写明了身份backbone: Flux2Edit、cfm_class: CFMEdit。它的职责是给定语义条件、声学条件和当前加噪 latent预测流速度场然后沿时间反向积分出干净 latent。拆开看有四层设计。混合主干MMDiT DiT。共 30 层10 层双流 MMDiT 块 20 层单流 DiT 块num_layers: 10/num_single_layers: 20隐藏维度 1536dim: 1536、24 个注意力头heads: 24、SwiGLU FFN 放大 2 倍约 1.5B 参数。双流块做联合注意力两条流各自投影出 Q/K/V 并施加 RoPE再把注意力张量拼接做交叉交互但残差通路彼此独立20 层单流块则把两条流沿序列维拼接后统一精修。attn_backend: flash_attn说明训练用 Flash Attention推理时 CLI 会切回 torch 后端以去掉依赖。条件流匹配CFM目标。训练时对干净 latent z_1 和标准高斯噪声 z_0 做线性插值目标是预测恒定速度z_t (1-t)·z_0 t·z_1 v_t z_1 - z_0对预测速度 v̂_t 施加掩码 MSE 损失只统计有效帧。时间 t 的采样方式值得注意t_sampling: logistic_normal、P_mean: -0.8、P_std: 0.8——即 t σ(u)u ~ N(-0.8, 0.8²)。把采样重心偏向小 t更接近高斯噪声端的脏状态让模型在最困难的去噪区间投入更多训练容量。推理时用 Euler ODE 求解器积分基础版 AuK 用 32 次函数评估NFE CFG 2.0。条件 dropout 与双形态生成。为了让同一个模型既能文本生成、又能参考条件编辑训练时施加分层条件 dropout以 0.3 概率丢弃声学条件再以 0.2 概率整体丢弃声学语义全丢。这样模型学会了三种运行形态全条件、仅语义、无条件推理时通过 CFG 拉高指令跟随度。后训练与蒸馏。预训练走两阶段课程先 50k 步纯生成预热建立稳定的 TTS 对齐再 600k 步联合生成与编辑。后训练兵分两路——编辑任务用人类反馈三层序数打分 flow 版 DPO 得分 LiPO 序数列表损失做偏好优化生成任务用 Flow-GRPO 做强化学习奖励由 ASR 识别正确率、说话人嵌入余弦相似度和 Qwen2.5-Omni-7B 风格一致性判官组成。最后用一致性初始化 任务路由 Decoupled DMDAPG 引导蒸馏出AuK-Flash4 步推理、无需 CFG相对 32-NFE CFG 2.0 的完整模型获得4.5 倍墙钟加速。值得一提的工程巧思是任务路由把分离类任务从 DMD 分布匹配中摘出来、改走监督的干净 latent 回归因为作者观察到统一 DMD 会让分离输出退回未处理的混合音——这是把理论方法落地时的真实坑位。BigVGAN-Flow VAE把 64 维 latent 还原成 24kHz 波形VAE 是这套系统里最容易被低估的一环它同时承担两个角色参考音频的条件编码器以及目标波形的重建解码器。config 中的关键参数vae_name: BigVGANFlowVAE、latent_dim: 64、downsample_rate: 480、target_sample_rate: 24000。编码器把 24kHz 单声道波形以480 倍下采样压缩成 64 维 latent帧率 50Hz先用 3 核卷积投影到 12 通道再经 6 个下采样块strides 依次为 2,2,2,3,4,5通道 12→24→48→96→192→384→768每块内含 6 个 dilation 为 (1,2,4,8,16,32) 的残差单元最后卷积输出 128 通道参数化 64 维后验的均值与对数方差。为了把 latent 分布正则化到标准高斯编码器后接一个由 4 层残差耦合层组成的归一化流——但它只在 VAE 训练阶段生效声学条件与重建都在原始 latent 空间进行。解码器走 BigVGAN 路线3 帧 look-ahead 卷积把 latent 投影到 1536 通道后全部转为因果卷积6 个转置卷积块strides 5,4,3,2,2,2通道 1536→24每块后跟抗混叠多周期组合模块残差分支 kernel {3,7,11}、dilation {1,3,5}配合 SnakeBeta 激活逐通道重建波形。config 中upsample_initial_channel: 1536、causal: true、snake_logscale: true与之完全对应。因果解码器意味着理论上可以流式输出这是为实时应用留的口子。训练目标是四件套加权多尺度 log-mel L1 重建损失λ15 多周期判别器与多尺度 CQT 判别器的 LS-GAN 对抗损失λ1 特征匹配损失λ2 KL 正则λ5在约 300 万小时语音/音乐/通用音频上6:3:1 采样训了 124 万步。重建评测的成绩单相当硬Seed-TTS-Eval 上 PESQ4.143、STOI0.982AudioSet 通用音频 PESQ 3.833MUSDB18-HQ 音乐 PESQ 3.884——三个域全面领先对比的四个 VAE。一个 VAE 能同时扛住语音、音乐和通用音频正是统一模型的地基。数字说话生成、编辑、增强三线成绩与真实短板统一模型的价值最终要靠基准检验。核心结论如下均出自技术报告零样本 TTSSeed-TTS-EvalAuK 平均识别错误率2.65%、说话人相似度 SIM0.795双双优于此前最强的 Qwen3-TTS3.07%与 Seed-TTS0.778AuK-Flash 以 4 步推理仍拿到 2.85% / 0.790。指令 TTSInstructTTSEval DSD中文83.37%超出 Qwen3-TTS-VD 2.27 个百分点。通用语音编辑MMAE-SpeechAuK 指令跟随率 IFR 48.23%、属性保持率 CR 88.11%相对最强基线 Step-Audio-EditX 分别提升 4.71 与 10.84 个百分点。SpeechEditBench内容编辑联合成功率从 Ming-UniAudio 的 76.46% 拉到91.83%韵律编辑从 26.50% 拉到 71.33%。自由形式编辑Ming-Freeform-Audio-Edit Full中文语义编辑 WER 从 10.46% 降到3.09%英文从 14.28% 降到3.96%。增强与分离DNS Challenge 上 dWER 低至2.66%优于 RE-USE 的 3.31%CHiME-4 上 AuK-Flash WER 7.84%Libri2Mix 双人分离 SIM 0.96。同样值得诚实记录的是短板SpeechEditBench 的情绪编辑成功率仅9.94%与内容/韵律编辑的 91.83%/71.33% 形成鲜明反差——情绪这种高度主观的副语言属性仍是统一模型的软肋社区实测也印证了情绪编辑能力薄弱的反馈输入音频时长上限约为 30 秒训练语料 utterance 分布在 1-35 秒。技术报告还披露了两个有趣的涌现现象模型能从正常↔耳语编辑对中迁移出直接从文本风格指令合成耳语的能力也能把只在中文方言上训练的去口音能力泛化到印地语、日语口音的英语上。此外作者坦承模型的原生自由形式指令理解并不完美——实际系统依赖一个 Prompt Enhancer 前置模块做任务路由、参数归一化和指令改写才能稳定达到能力上限这恰恰是社区评测里指令驱动体验差异的来源。从配置到部署仓库里的工程落地细节最后落到代码仓库本身。这个仓库极简但信息密度极高auk_base.safetensors扩散 Transformer layer-fusion 权重、vae.safetensors、config.yaml 和 README.md。几个值得工程师留意的点权重分发是三件分离主干、VAE、MLLM 编码器各是独立文件推理时按 config.yaml 的text_encoder_path、vae_model_path分别加载。社区反馈的显存要求较高正源于此——除了 1.5B 主干还要常驻一个 3B 的 Qwen2.5-Omni 编码器。训练期的显存策略写在了配置注释里checkpoint_activations: Truecheckpoint_every_n_layers: 4梯度检查点把峰值从约 91G 降到约 75G这是 256 卡 DeepSpeed ZeRO-2 bf16 训练配置的一部分。部署生态README.md 记录了 SGLang-Omni 在开源当天即完成 Day 0 支持一条命令python -m sglang_omni.cli serve --model-path tencent/AuK即可拉起服务社区侧还有 Gradio、ComfyUI 等多种接入路径。小结AuK 的价值不在某一项指标的登顶而在于证明了生成与编辑可以在同一个扩散 Transformer 里被自然语言统一调度Qwen2.5-Omni 负责把指令与参考音频读成语义条件Flux2Edit 用双流 MMDiT 单流 DiT 做条件流匹配BigVGAN-Flow VAE 把 64 维 latent 还原成 24kHz 高保真波形。三层模块各司其职、全部开源配 MIT 协议与可商用的开放姿态这让它不仅是研究样本更是语音创作者与 AI 工程师可以直接上手的工作台——而情绪编辑的 9.94% 与 30 秒时长上限也清楚标出了这个方向下一站要攻克的山头。【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考