ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

AuK:统一自然语言指令驱动的开源语音生成与编辑基础模型 —— 架构解析、任务全景与部署实践

AuK:统一自然语言指令驱动的开源语音生成与编辑基础模型 —— 架构解析、任务全景与部署实践 人工智能基础模型语音音频媒体生成【免费下载链接】AuK项目地址https://ai.gitcode.com/tencent_hunyuan/AuK点击查看免费下载导读本文以 Tencent Hunyuan 开源仓库 README.md 为核心系统解读AuK这一 1.5B 参数语音基础模型它如何通过一个统一的自然语言指令接口同时覆盖零样本 TTS、语音内容/声学/副语言编辑、语音增强与音源分离等 15 项任务。你将掌握 AuK 的整体架构设计扩散主干 MLLM 编码器 流匹配 VAE、完整权重下载与目录组织方式、SGLang-Omni 快速推理启动命令以及各任务在统一指令范式下的能力边界。全文以仓库内 config.yaml 等真实配置为源码级佐证可直接指导实操。一、项目概览一个模型、两大变体、统一指令接口AuKAuK: An Open-Source Foundational Model for Speech Generation and Editing是一个 1.5B 参数的语音生成与编辑基础模型。据 README.md 介绍它基于数百万小时的多样化音频数据训练而成核心设计哲学是一切任务都通过同一种自然语言指令接口暴露用户不需要针对每种任务切换专用模型或专用 API 格式。AuK 提供两个官方变体模型说明特点AuK高质量生成基础模型本仓库包含其官方权重AuK-Flash蒸馏加速模型支持4 步快速推理4-step distilled inference适合对延迟敏感的场景需要说明的是本仓库发布的是AuK base 模型的官方权重AuK-Flash 为可选的加速蒸馏版本两者在使用上共享同一套指令接口与推理流程。从仓库文件结构auk_base.safetensors、vae.safetensors可以看出基础权重与 VAE 权重在仓库中分开存放这也与下文运行时从独立文件加载 VAE的机制一致。二、模型架构指令理解 → 扩散生成 → 流匹配 VAE 解码README 将 AuK 的架构概括为基础模型 MLLM 编码器 VAE其中模型 checkpoint 内包含Diffusion Transformer 与 layer-fusion 权重而MLLM 编码器与 VAE 在运行时从独立文件加载。仓库根目录的 config.yaml 为我们提供了架构层级的完整参数依据可以还原出如下全链路输入侧指令与条件理解text_encoder.text_encoder_path: ckpts/Qwen2.5-Omni-3BAuK 复用Qwen2.5-Omni-3B多模态大语言模型MLLM作为文本/指令编码器负责把自然语言指令如把这段语音换成开心的语气编码为条件特征。这是 README 中统一自然语言指令接口的底层实现——指令语义理解完全交给通用 MLLM而不用为每个任务单独训练语义模块。架构侧text_hidden_dim: 2048定义了文本特征维度用于与音频隐空间条件对齐。生成侧扩散主干model.backbone: Flux2Edit生成主干采用Flux 风格的 Diffusion TransformerDiT结构包含双流attention与单流single attention层配置num_layers: 10、num_single_layers: 20模型宽度dim: 1536、注意力头数heads: 24、FFN 扩展倍数ff_mult: 2。model.cfm_class: CFMEdit采用条件流匹配Conditional Flow Matching作为生成目标的训练范式配合schedule.t_sampling: logistic_normal对数正态时间采样以及P_mean: -0.8、P_std: 0.8的调度超参控制扩散/流匹配过程中的时间步采样分布。输出侧声码器vae.vae_name: BigVGANFlowVAE采用融合流匹配的BigVGAN 家族 VAE作为神经声码器将隐空间表征还原为波形。关键参数如下配置项值含义latent_dim64隐空间通道数downsample_rate480整体下采样倍率target_sample_rate24000输出目标采样率24 kHzupsample_rates[5, 4, 3, 2, 2, 2]上采样倍率序列upsample_kernel_sizes[10, 8, 6, 4, 4, 4]上采样卷积核resblock_kernel_sizes[3, 7, 11]残差块卷积核downsample_channels[12, 24, 48, 96, 192, 384, 768]各下采样层通道数snake_logscaletrue使用 Snake 激活对数尺度causaltrue因果卷积支持流式/低延迟解码flow_hidden_channels256流匹配分支隐藏通道推理侧配置细节attn_backend: flash_attn默认启用 FlashAttention但配置注释明确说明CLI 在推理时会覆盖为torch避免引入 flash_attn 依赖checkpoint_activations: True配合checkpoint_every_n_layers: 4启用梯度检查点注释显示该设置可将峰值显存从约 91G 降至约 75G这为后续微调场景提供了显存预算参考。从源码结构看AuK 的layer-fusion权重与config.yaml中双流/单流层并存的结构相互印证——它表明扩散主干内部存在跨层特征融合机制以增强编辑类任务对局部音频特征音色、情感、韵律的精准控制。三、支持的任务全景六大类别、15 项任务、一种指令范式AuK 的能力覆盖面是其核心卖点不需要换模型、不需要改接口只需用自然语言描述想做什么模型即可完成对应任务。README 中的任务总表Supported Tasks按类别完整列出如下类别任务说明语音生成Zero-shot TTS用参考音频的音色朗读目标文本语音生成Instruct TTS仅凭一句语音描述生成语音无需参考音频内容编辑Speech Content Editing改写说了什么——替换、插入或删除文本内容内容编辑Lyric Editing改写演唱录音中的歌词同时保留旋律与音色声学编辑Pitch Editing按半音升高或降低音高声学编辑Speed Editing调整语速输出长度随速度系数伸缩声学编辑Volume Editing按分贝升高或降低音量副语言编辑Emotion在保留内容与音色的前提下改变情感副语言编辑Timbre按描述改变音色内容保持不变副语言编辑De-accent去除地域口音同时保留说话人音色与内容副语言编辑Nonverbal Editing移除或添加呼吸、笑声、咳嗽等非言语声音副语言编辑Whisper Conversion在正常语音与耳语之间转换保留说话人与内容增强与分离Speech Enhancement降噪、去混响恢复自然清晰的语音增强与分离Speech Separation按说话顺序只保留某一位说话人移除其他声音增强与分离Music Separation从混合音频中提取人声或保留所有人类声音增强与分离Target Speaker Extraction依据说了什么锁定并保留目标说话人要点解读任务粒度可组合例如De-accent Emotion Volume Editing可以串联成一条流水线全部通过自然语言描述驱动这是传统单任务系统难以做到的。编辑任务的核心约束README 在每项编辑任务的描述中都强调保留音色/内容/旋律等不变属性这说明 AuK 的编辑能力建立在条件解耦之上——扩散主干 layer-fusion 机制让模型能独立操控内容、声学与副语言三个维度的表征。增强与分离任务被纳入统一接口语音增强、人声/音乐分离、目标说话人提取这些传统上由专用模型承担的任务在 AuK 中同样通过指令触发体现了基础模型统一多任务的范式迁移。说明完整版 README 中每项任务均附带指向 Cookbook 章节的链接提供对应指令模板及 CLI/Python 示例当前镜像仓库以 README 与配置为发布主体实践时可结合官方 Hugging Face/ModelScope 演示空间验证各任务的指令效果。四、权重下载与目录组织两条渠道、三份组件AuK 的推理需要三份组件AuK 基础权重含 Diffusion Transformer 与 layer-fusion 权重、MLLM 编码器Qwen2.5-Omni-3B以及VAE 权重。README 提供了 Hugging Face 与 ModelScope 两条等价下载渠道。Hugging Face 渠道pip install -U huggingface_hub[cli] # AuK-Base hf download tencent/AuK --local-dir ./ckpts/AuK # AuK-Flash (4-step distilled) hf download tencent/AuK-Flash --local-dir ./ckpts/AuK-Flash # MLLM Encoder hf download Qwen/Qwen2.5-Omni-3B --local-dir ./ckpts/Qwen2.5-Omni-3BModelScope 渠道pip install -U modelscope # AuK-Base modelscope download --model Tencent-Hunyuan/AuK --local_dir ./ckpts/AuK # AuK-Flash (4-step distilled) modelscope download --model Tencent-Hunyuan/AuK-Flash --local_dir ./ckpts/AuK-Flash # MLLM Encoder modelscope download --model Qwen/Qwen2.5-Omni-3B --local_dir ./ckpts/Qwen2.5-Omni-3B期望的目录结构ckpts/ ├── AuK/ ├── AuK-Flash/ # optional └── Qwen2.5-Omni-3B/关于权重组成的关键注意事项README 原话要点模型 checkpoint 仅包含diffusion transformer 与 layer-fusion 权重MLLM 编码器与 VAE 在运行时从独立文件加载对应仓库中的 vae.safetensors配置项vae.vae_model_path: ckpts/AuK/vae.safetensors即指向该路径因此checkpoint 加载过程中缺少text_encoder.*键是预期行为无需视为异常——这是 AuK 模块化设计的直接体现模型本体与语义编码器解耦可独立升级或替换。五、快速推理SGLang-Omni 的 Day 0 支持AuK 在开源之初即获得了SGLang Omni团队的 Day 0 支持。使用 SGLang Omni 启动 AuK 服务的命令非常简洁python -m sglang_omni.cli serve --model-path tencent/AuK该命令以模型在 Hugging Face 上的 IDtencent/AuK作为--model-path直接拉起服务SGLang Omni 负责加载 MLLM 编码器、扩散主干与 VAE 并完成推理管线编排。这一路径适合需要服务化部署、并发推理或进一步做推理优化的场景对更详细的配置选项与优化路线README 指向 SGLang Omni 官方 Cookbook 中的 AuK 专题与对应的优化 Roadmap 议题。提示若仅做单次实验也可直接从 Hugging Face / ModelScope 演示空间体验各任务效果仓库本身以发布权重与配置为主不包含本地 CLI 训练脚本。六、性能表现跨四类任务的能力验证README 的性能章节展示了 AuK 在语音生成speech generation、语音编辑editing、语音增强enhancement与音源分离separation四类基准上的性能对比图。该图传达的核心信息与本文脉络一致一个模型在同一指令接口下于四类任务上都具备与领域专用模型可比或更优的竞争力。需要客观看待的是具体数值与对比对象以官方技术报告见下节引用条目为准本文不展开未经仓库确认的数据细节。七、引用与许可学术引用使用 AuK 进行研究时可引用官方技术报告条目misc{ma2026auktechnicalreportopensource, title{AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing}, author{Ziyang Ma and Zhikang Niu and Wenming Tu and Tianrui Wang and Ruiqi Yan and Junxi Liu and Yanru Huo and Nickk Huang and Yang Liu and Qicong Xie and Zeyu Xie and Hui Wang and Haitao Li and Zixuan Jiang and Yalin Li and Jie Fang and Yifan Duan and Zeyue Tian and Guangzheng Li and Haina Zhu and Shuyi Wang and Jinwen Wang and Mingyu Cui and Tian Tan and Auden and Sen Liang and Steve Yves and Shan Yang and Liefeng Bo and Zilong Zheng and Kai Yu and Eng-Siong Chng and Xie Chen}, year{2026}, eprint{2609.08936}, archivePrefix{arXiv}, primaryClass{cs.SD}, url{https://arxiv.org/abs/2609.08936}, }开源许可AuK 采用MIT License发布完整条款见仓库 LICENSE。该许可以开放方式覆盖训练代码、推理代码、参数与权重允许自由使用、修改与再分发适合社区二次开发与商业集成。总结AuK 给语音 AI 工程带来的三个关键启示指令即接口将 TTS、编辑、增强、分离全部收敛到自然语言指令范式显著降低多任务系统的工程复杂度——text_encoder复用通用 MLLMQwen2.5-Omni-3B是关键实现决策见 config.yaml。模块化解耦基础权重、MLLM 编码器、VAE 三份组件独立加载README 明确缺少text_encoder.*键属预期行为使组件可独立升级也为不同部署形态离线批处理 vs 服务化推理提供灵活性。扩散 流匹配的统一生成框架Flux2Edit 主干 CFMEdit 条件流匹配 BigVGANFlowVAE 的组合config.yaml让一个模型同时胜任生成与精细编辑配合 AuK-Flash 蒸馏变体可在质量与速度之间取舍。赞分享人工智能基础模型语音音频媒体生成【免费下载链接】AuK项目地址https://ai.gitcode.com/tencent_hunyuan/AuK点击查看免费下载相关推荐腾讯开源1.5B语音基础模型AuK全面解析一套自然语言指令统一语音生成与编辑腾讯开源1.5B语音基础模型AuK全面解析一套自然语言指令统一语音生成与编辑 AuK 是腾讯开源的 1.5B 参数语音基础模型基于数百万小时多样化音频数据训人工智能基础模型语音音频媒体生成AuK如何实现自然语言指令统一控制14语音任务代码实现原理逐层解读AuK如何实现自然语言指令统一控制14语音任务代码实现原理逐层解读 AuK 是腾讯混元开源的 1.5B 参数语音生成与编辑基础模型 核心能力正是 用一句自人工智能基础模型语音音频媒体生成Dify工作流HTTP请求配置外部服务集成与API调用技术实现Dify工作流HTTP请求配置外部服务集成与API调用技术实现 在Dify工作流编排中HTTP请求节点是实现外部服务集成的核心组件它允许工作流与第三方AP示例工程创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表