ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

RVC 变声框架上手指南:用 10 分钟语音数据训练你自己的变声模型

RVC 变声框架上手指南:用 10 分钟语音数据训练你自己的变声模型 RVC 变声框架上手指南用 10 分钟语音数据训练你自己的变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI下称 RVC是一个基于 VITS 的开源变声Voice Conversion框架你只需准备约 10 分钟的语音样本就能在普通显卡上训练出一个音色转换模型把任意音频变成目标音色说话并支持端到端 170ms 延迟的实时变声。先看懂它的 5 个核心价值top1 检索防音色泄漏推理时从训练集检索最接近的特征替换源特征输出音色稳定不跑偏训练门槛低入门级显卡即可训练官方 FAQ 明确 4GB 显存还有救数据量小推荐 10~50 分钟低底噪语音高质量数据 5~10 分钟也能出可用结果模型可融合ckpt-merge 功能可以把多个模型权重按比例混合微调音色全平台支持NVIDIA CUDA、AMD ROCm/DirectML、Intel IPEX 三条路线都能跑环境门槛装之前先看你的机器软件与硬件要求Python 3.8若走 Poetry 路线建议 3.7~3.10新版会与llvmlite0.39.0冲突系统已安装 ffmpeg / ffprobeUbuntu 用sudo apt install ffmpegmacOS 用brew install ffmpegWindows 把 ffmpeg.exe 和 ffprobe.exe 放到项目根目录显存参考训练 4GB 起步3GB 的 1060 及更低建议放弃推理对显存要求更低内存训练和预处理会开多进程内存紧张时先调低提取音高和处理数据使用的 CPU 进程数最佳配置建议8GB 以上显存的 N 卡 fp16 半精度可同时跑训练和实时推理且能开最大检索缓存见后文调优。三种显卡的安装步骤先获取代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI然后按你的显卡选一条路线安装先装 PyTorch 本体已装可跳过NVIDIA 卡推荐路线pip install torch torchvision torchaudio pip install -r requirements.txtWindows Ampere 架构RTX 30 系建议指定 CUDA 11.7 的 wheelpip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117AMD 卡pip install -r requirements-dml.txtAMD 卡想走 ROCm仅 Linux则改用requirements-amd.txt并按官方文档安装 ROCm 驱动。Intel 卡仅 Linux IPEXpip install -r requirements-ipex.txt source /opt/intel/oneapi/setvars.sh下载预训练模型RVC 运行还需要一批预模型Hubert 特征提取器、VITS 底模、UVR5 人声分离权重等清单如下项目内tools/目录提供了download_models.py、dlmodels.sh等下载脚本官方仓库也发布了RVC-beta.7z整合包可一步到位assets/hubert/hubert_base.ptassets/pretrained/v2 模型还需assets/pretrained_v2/assets/uvr5_weights/RMVPE 音高提取参数rmvpe.pt放根目录A/I 卡 DML 环境用rmvpe.onnx第一次跑通从零到第一段转换音频整体流程是备料 → 一键训练 → 模型推理全部在 WebUI 里点按钮完成。第 1 步启动 WebUIpython infer-web.pyWindows 整合包用户双击go-web.bat即可macOS 可用sh ./run.sh。启动后浏览器自动打开界面默认端口 7865可用--port修改--noautoopen可禁止自动打开。界面包含数据处理/训练、模型推理、语音分离UVR5、ckpt 处理等选项卡。第 2 步准备训练集收集 10~50 分钟低底噪、音色统一的语音切成若干段放进一个文件夹。质量比数量重要底噪大的数据训练集再好也带不高音质。第 3 步一键训练在训练选项卡填入训练集文件夹路径和实验名执行一键训练。流程会自动串联切片 → 提取音高F0→ 提取特征Hubert→ 训练 VITS 模型 → 训练检索索引。结束后你会得到两类产物logs/实验名/下的 checkpointG/D 文件用于续训几百 MB不要拿它分享weights/实验名.pth约 60MB用于推理和分享的模型logs/实验名/added_*.index检索索引文件推理时与 pth 配合使用epoch 建议音质一般的训练集 20~30 轮足够高音质、时长足的可拉到 200 轮。第 4 步推理出第一段音频到模型推理选项卡刷新音色选择刚训练的模型和对应 index上传一段待转换音频点转换。两个关键参数先记住f0 移调半音不改变调就填 0index_rate0~1 之间控制音色向训练集靠拢的程度原理见下一节听到输出你就跑通了全流程。目录结构导读每个文件夹管什么Retrieval-based-Voice-Conversion-WebUI/ ├── infer-web.py # WebUI 入口组装各选项卡 ├── infer/ │ ├── modules/vc/ # 变声主逻辑pipeline、模型加载、批量推理 │ ├── modules/train/ # 切片、F0 提取、特征提取、训练脚本 │ ├── modules/uvr5/ # 人声/伴奏分离 │ ├── lib/infer_pack/ # 推理模型定义、注意力、F0 预测器 │ └── lib/jit/ # JIT 加速的 Hubert/RMVPE/合成器封装 ├── configs/ # v1/v2 各采样率训练配置 inuse/ 运行副本 ├── assets/ # 预训练权重、Hubert、UVR5 权重、训练产物 weights/ ├── tools/ # 批量推理、导出 ONNX、实时 GUI、模型下载脚本 ├── i18n/locale/ # 13 种语言的界面翻译 └── docs/ # 中英法日韩葡土 7 种语言文档与 FAQ两个值得知道的细节configs/ 启动时会自动把v1/、v2/配置复制到configs/inuse/改参数要改 inuse 下的副本否则下次启动被覆盖。v1 支持 32k/40k/48k 三档采样率v2 支持 32k/48k。infer/modules/vc/pipeline.py 是推理主线的核心音高提取、特征检索、模型合成三步都在这里串起来。工作原理拆解RVC 到底怎么变声用大白话走一遍推理链路训练同理音高提取F0从你的输入音频里逐帧提取基频曲线——就是你说话时声音的高低。可选 RMVPE默认速度最快、效果最好InterSpeech 2023 算法、Harvest、PM 等方法。特征提取用预训练的 HuBERT 模型把音频转成一串声学特征向量描述这段话说了什么内容。top1 检索拿源特征去训练集特征库就是那个 .index 文件用 FAISS 建的向量索引里找最接近的一条替换掉源特征——这一步是防音色泄漏的关键如果只做第 2 步输出的音色会被推理源和底模带偏检索替换后音色锚定在训练集上。模型合成VITS 模型吃进音高曲线 检索后的特征 目标说话人编号直接生成波形。VITS 是自回归声码器一体的架构一次前向出音频所以推理快。细节修正可选 RMS 响度混合、低通滤波filter_radius等后处理让输出更自然。训练侧则是切片 → 提取 F0 与特征 → VITS 的判别器生成器对抗训练c_mel45, c_kl1.0的 mel 与 KL 损失见 configs/v1/48k.json→ 最后用训练集特征批量构建 FAISS 索引。调参手册显存、epoch 与 index_rate按显存调推理缓存configs/config.py 末尾的四个变量代码会自动按显存档位设置可手动覆盖档位x_padx_queryx_centerx_max6GBfp1631060655GBfp321638414GB153032旧卡1060/1080/P40 等会自动强制 fp32 并写入use_fp32_config无需手动处理。按数据质量调 epoch底噪大的训练集 20~30 轮封顶调再高底模也救不回来高音质时长足的数据可以给到 200 轮。按需求调 index_rate调高趋近 1→ 音色更贴训练集但音质上限被训练集锁死调低趋近 0→ 音质可被高质量推理源拉高但音色开始往推理源/底模漂。训练集本身优质且时长多时index_rate 基本不重要。其他常用开关resample_sr推理时重采样可进一步提亮音质protect保护低频能量减少破音多卡推理config.py里device cuda:N选卡号卡号映射在训练选项卡的显卡信息栏可见排障手册报错速查现象原因解法ffmpeg error / utf8 error路径含空格、括号或中文把训练集移到纯英文无特殊字符的路径一键训练完成但没有 added 开头的索引训练集太大索引步骤卡死再点一次训练索引或分批添加训练完推理刷不到新音色缓存未刷新点刷新音色仍没有则看logs/实验名下的日志找训练报错Cuda out of memory显存不足训练时调小 batch size降到 1 还不够就换卡推理时调小 x_pad/x_query/x_center/x_maxConnection Error你关掉了黑色控制台窗口保持终端开着运行Expecting value: line 1 column 1局域网/全局代理拦截了 localhost 请求关掉系统代理AutoDL 等环境的 http_proxy 也要 unsetCould not load llvmlite.dllWindows 缺 VC 运行库安装 Visual C Redistributable (x64) 后重启 WebUIexpanded size of the tensor (17280) must match (0)训练集里有异常小的音频文件进 wavs16k 文件夹找出明显偏小的文件删掉重新训练需补点训练索引size of tensor a (24) must match b (16)中途改了采样率续训换实验名从头训练可拷贝 0/1/2/2b 文件夹加速想中断/继续训练只能重启进程关控制台重新启动 WebUI相同参数再点训练即从 checkpoint 续训另外提醒想分享模型打包weights/实验名.pthadded_*.index不要把logs/下几百 MB 的 checkpoint 直接拿去推理会报 f0、tgt_sr 等 key 不存在的错需要时可用 ckpt 选项卡做小模型提取。落地场景它适合做什么实时变声go-realtime-gui.bat启动实时 GUI端到端延迟 170ms配 ASIO 声卡可压到约 90ms适合游戏、直播、语音房歌曲翻唱/有声内容批量推理vc_multi一次转完整张专辑配合 UVR5 先做人声伴奏分离转完再合回伴奏配音与角色音用少量角色语音样本训练定制音色批量替换配音稿数据与科研tools/infer_cli.py、tools/infer_batch_rvc.py 支持脚本化批量转换tools/export_onnx.py 可导出 ONNX 部署到边缘设备文档与社区遇到问题去哪问多语言文档齐全docs/ 下有中文、英文、日文、韩文、法文、葡文、土文 7 个版本的 README、FAQ、训练技巧training_tips与 FAISS 索引说明界面本身也随系统语言自动切换i18n/locale/ 含 13 种语言版本节奏跟随 docs/cn/Changelog_CN.md 查看每次更新官方在 README 中预告了参数更大的 RVCv3 底模反馈渠道项目的 issue 跟踪、Discord 开发者社区见 README 徽章是主要反馈入口训练/推理报错可截取控制台与 WebUI 画面一并提交写在最后RVC 把训练一个可用变声模型的门槛压到了 10 分钟录音 一次一键训练音质、延迟和跨平台支持都给出了明确的工程答案。如果你手边有一段干净的人声样本现在就可以把它放进训练集文件夹跑通你的第一段转换音频。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表