ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

用 10 分钟录音训练出一个可用的 RVC 变声模型

用 10 分钟录音训练出一个可用的 RVC 变声模型 用 10 分钟录音训练出一个可用的 RVC 变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based Voice Conversion WebUI解决一个问题喂给它 10 分钟目标人声录音之后任何音频都能以那个音色重新输出。切分、音高提取、特征提取、模型训练全部由项目自动化。你只需提供干净音频和几次点击。适合给视频配音、给游戏角色换声、做翻唱的内容创作者不适合想零代码运行、没有独立显卡的人。动手前先判断能不能跑三个数字对着检查再决定走不走显存 4GB 是底线。官方 FAQ 原话2GB/3GB 显卡可以直接放弃4GB还有救。训练时 batch size 缩到 1 仍 OOM就是显卡不够Python 3.12 x64。本分支按它构建Ubuntu 24.04 是官方推荐系统内存切分和音高提取走 CPU 多进程建议 16GB 以上不够就把CPU 进程数调低硬件不达标云 GPU 训练通常比等一张二手卡划算。最短可运行路径从 clone 到打开训练页克隆仓库、建虚拟环境。后续所有命令都在仓库根目录执行git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv .venv source .venv/bin/activate # Windows: .venv\Scripts\activate装 ffmpeg切分和重采样都靠它再按显卡装依赖。以下按 NVIDIA 50 系以前写法50 系把 cu118 换成 cu128sudo apt install ffmpeg # macOS: brew install ffmpeg python -m pip install torch2.7.1cu118 torchaudio2.7.1cu118 \ --index-url https://download.pytorch.org/whl/cu118 --extra-index-url https://pypi.org/simple python -m pip install -r requirments_cu118_py312.txt # 无 NVIDIA 卡CPU/AMD/Intel直接装 requirments_cpu_py312.txt下载底模缺了 assets 下的文件训练和推理都起不来python -m pip install --upgrade huggingface_hub hf download lj1995/VoiceConversionWebUI --revision main --include hubert_base/* --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main --local-dir assets/rmvpe hf download lj1995/VoiceConversionWebUI --revision main --include pretrained/* pretrained_v2/* --local-dir assets启动python webui.py # 等约 30 秒浏览器自动打开 7865 端口的训练页Windows 用户也可以直接双击 go-webui.bat。训练音频备 10~50 分钟切成几十秒一段的 WAV。训练页里填训练集路径和实验名勾选音高点一键训练流程按切分、音高提取、特征提取、训练依次执行日志全在logs/实验名/。关键参数拆解页面字段很多真正影响结果的是这四个参数推荐值为什么这么设调错的后果总轮数epoch有底噪 20~30干净且时长足 200噪音也会被学轮次越多刻得越深训太多噪音被放大训太少音色不稳保存间隔每 10 轮存一个间隔小才能逐个试听挑最早达标的存得稀只剩过拟合的存档批次大小用页面默认值程序按显存自动估算约显存 GB 数一半稳定起步值调高了直接 OOM底模 采样率v2 底模 48kconfigs/v2/48k.json 是官方配置里质量上限最高的一档选 v1 40k 音质上限低一档表格装不下的三个细节音高算法只有 rmvpe 和 pm 两个选项默认选 rmvpeInterSpeech 2023 的获奖算法速度快、显存占用小歌声输入追求速度可换 pm推理时的 index rate范围 0~1默认 0.75。拉高到 1音色完全锚定训练集音质上限被训练集锁死拉到 0不做检索保护音色泄露会回来protect 滑条保护清辅音和呼吸声输出有电音、撕裂感时往高调实验名是整个流程的唯一标识checkpoint、索引、日志都按它命名。别拿同一个名字训不同音色文件会互相覆盖。容易卡住的点训练 OOMbatch size 已缩到 1→ 显存不够这是硬件上限。FAQ 的答案是换卡或上云 GPU别反复重试一键训练结束没看到 added_ 开头的索引文件→ 训练集太大添加索引步骤内存吃紧。重按一次训练索引即可ffmpeg error / utf8 error→ 大概率是路径问题不是 ffmpeg 问题。路径里的空格、括号、中文都会触发把训练集挪到纯英文路径即可切分时报内存 errorfile page error→ CPU 进程开太多内存炸了。调低CPU 进程数或手工把训练音频切到 1 分钟以内验证与下一步三条成功判据按顺序核对assets/weights/下有 60MB 的小模型。它是从logs/实验名/里几百 MB 的 pth 用 ckpt 选项卡提取出来的别直接把 logs 下的 pth 拿去推理assets/indices/下有 added_ 开头的 .index 文件由训练索引生成推理页选中该模型和索引上传一段训练里没出现过的音频转换后音色与训练集一致且辅音不撕裂三条都过整个流程就跑通了。之后可以拿 realtime_gui.py 试实时变声端到端延迟 170ms用 ASIO 声卡能压到 90ms。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表