ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

RVC 语音转换快速上手:10 分钟完成第一个音色克隆

RVC 语音转换快速上手:10 分钟完成第一个音色克隆 RVC 语音转换快速上手10 分钟完成第一个音色克隆【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI想让一段 10 分钟的录音就能复刻出一个人的声音到底需要多少数据、多久能跑起来Retrieval-based-Voice-Conversion-WebUI下称 RVC是目前开源语音克隆方向里最实用的方案之一它基于 VITS用不到 10 分钟的干净语音就能训练出一个可用的 RVC 语音转换模型在网页界面里把你自己的录音实时或离线转换成目标音色。下面按装环境 → 训模型 → 出结果的顺序把整条流程走一遍。原理速览检索 特征转换是什么思路用大白话说RVC 分三步先用 HuBERT 从你的录音里提取内容特征——记的是说了什么而不是谁在说再用一个小模型把这些特征映射到训练集学到的音色上最后经声码器还原成音频。检索体现在推理时程序会为训练集的音色特征建一个索引把输入特征中最接近训练集的 top1 特征混进输入让输出音色始终贴近目标人不容易被底模或源音频带偏社区称之为音色泄漏。底模由接近 50 小时的开源 VCTK 数据预训练音质有下限这是少量数据就能出活的原因。如何准备训练数据数据质量比数据数量更决定上限官方 FAQ 给出的建议是时长推荐 10~50 分钟音色有特色、底噪低时 5~10 分钟也够用干净避免背景音乐、混响和明显底噪路径训练集目录尽量不含中文和空格ffmpeg 报错和 utf8 报错大多是路径问题采样率训练管线内部统一重采样到 16k 做特征提取输出采样率在界面里选 40k 或 48k。RVC 安装教程按显卡类型装依赖环境要求 Python 大于 3.8。克隆仓库并安装依赖NVIDIA 卡git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txt其他平台各有对应的依赖文件A 卡Windows/DML用 requirements-dml.txtA 卡 ROCMLinux用 requirements-amd.txtIntel 卡 IPEXLinux用 requirements-ipex.txt。另外需要装好 ffmpegLinuxsudo apt install ffmpegmacOSbrew install ffmpegWindows 将 ffmpeg.exe 和 ffprobe.exe 放在根目录并从 Hugging Face 下载 assets 预训练模型与 rmvpe.pt 放到指定位置。完成后启动python infer-web.pyWindows 整合包用户直接双击 go-web.bat 即可省去装环境步骤。RVC 训练参数一张表看懂参数推荐值作用总轮数 total_epoch音质差 20~30音质高且时长多可到 200训练轮数低质量数据调太高底模带不动且易过拟合batch_size按显存调整每步训练样本数显存不够时优先缩小它数据时长10~50 分钟音色统一、底噪低时多多益善采样率 sr40k / 48k输出音频的采样率index_rate0~1 间调整调高更贴近训练集音色、抑制泄漏调低则推理源音色占比更高在训练选项卡填好实验名、训练集目录和上表参数点一键训练后会自动完成音频切片、特征提取、模型训练、索引训练四步。产物中logs/下的几百 MB pth 只用于断点续训真正用来分享和推理的是weights/下 60 MB 的 pth 加added_*.index索引文件。进阶玩法实时变声与人声伴奏分离实时变声Windows 双击 go-realtime-gui.bat 启动普通音频设备端到端延迟 170ms换用 ASIO 输入输出设备可压到 90ms比较挑硬件驱动。适合直播变声、K 歌、语音房这类场景。人声伴奏分离WebUI 内置 UVR5 模型调用权重放在assets/uvr5_weights/。当你想从歌曲里提取纯人声当训练数据或把老歌的人声剥掉只留伴奏时用它省得单独装分轨工具。效果不理想先查这三点数据是否够干净大部分效果差的根因是训练集有底噪或有背景音乐换干净样本重训的收益远大于调参显存是否充足训练报 OOM 时缩小 batch_size推理 OOM 时缩小 config.py 结尾的 x_pad/x_query/x_center/x_max4GB 以下显存的显卡基本可以放弃索引与刷新音色不像目标人时确认用的是配套索引文件并调整 index_rate训练完没看到新音色先在界面点刷新音色再排查。结语适合谁不适合谁RVC 语音转换适合想低成本复刻某个固定音色的创作者和内容团队10 分钟数据、一张 4GB 以上显存的显卡、半小时内就能出可分享的模型文件。它的边界也很清楚——训练集音色越平淡越难训出辨识度多人混音、强情绪起伏的数据不适合直接喂给它。文档目录 docs/ 提供中、英、日、韩、法、土、葡等语言的说明docs/cn/faq.md 则收录了路径报错、llvmlite 缺失等高频问题遇到卡点可以先翻一遍。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表