ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

10分钟语音数据训练你的AI音色:RVC WebUI完整上手指南

10分钟语音数据训练你的AI音色:RVC WebUI完整上手指南 10分钟语音数据训练你的AI音色RVC WebUI完整上手指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI录10分钟一段歌手的人声在自己电脑上训练一个音色模型之后上传任意音频都会用这个音色重新演唱——整个过程一个晚上就能跑通。Retrieval-based-Voice-Conversion-WebUI下文简称 RVC WebUI就是一个基于 VITS 的开源 AI 声音转换网页工具小数据训练音色模型做音频到音频的变声。 项目速览RVC WebUI 做什么、不做什么先建立正确预期再动手基于 VITS 的变声框架利用检索式特征替换技术10分钟语音数据就能训练出可用模型提供 Gradio 网页界面覆盖数据集处理 → 训练 → 推理完整流程由 RVC-Project 开源社区维护有中文、英文、日文、韩文等多语言社区问题排查有参照MIT 许可证免费商用它不做什么只做音频 → 音频的声音转换不做文字转语音TTS你得有一段现成的人声音频作为输入不会自动清理脏录音背景乐、杂音需要你先分离界面内置的 UVR5 选项卡可以做人声分离️ 环境与硬件检查单按系统和显卡装依赖这一节只回答两个问题装哪些依赖、用什么命令启动。前提条件三件Python 版本大于 3.8系统安装 ffmpeg预训练模型文件就位仓库自带下载脚本 tools/dlmodels.sh首次运行整合包时会自动拉取先克隆仓库git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI各平台依赖安装与启动方式系统 显卡依赖安装命令启动方式Windows N卡pip install -r requirements.txt双击go-web.batWindows A卡/I卡DML加速pip install -r requirements-dml.txt双击go-web.batLinux/Mac N卡pip install -r requirements.txtbash run.sh或python infer-web.pyLinux A卡ROCmpip install -r requirements-amd.txtpython infer-web.pyLinux I卡IPEXpip install -r requirements-ipex.txt先执行source /opt/intel/oneapi/setvars.sh再启动如果还没有 PyTorch先执行pip install torch torchvision torchaudio pip install -r requirements.txtffmpeg 安装Ubuntu/Debiansudo apt install ffmpeg硬件门槛4GB 显存即可开始训练6GB 以上更从容。 第一次跑通准备10分钟语音数据并完成首次训练这是全文核心按准备素材 → 关键配置 → 执行 → 验证四段走每段都有明确产出物。准备语音素材录音要求很短目标音色的干净人声至少10分钟30~60分钟效果更好无背景音乐、无底噪、单人声避免破音失真WAV、MP3、FLAC 均可推荐 44100Hz 采样率带 BGM 的音频先切到 UVR5 选项卡做人声分离只留人声全部放进同一个文件夹例如assets/abs/产出物一个只含干净人声 wav 文件的文件夹。关键配置启动后Windows 双击go-web.bat命令行python infer-web.py浏览器打开http://127.0.0.1:7897进入0-前置数据集处理选项卡按下表配置配置项推荐值说明音高提取方法RMVPE效果最好、资源占用比 harvest 小采样率40k质量与速度平衡显存紧张选 32k批大小batch size1~8 按显存显存充足调大加速OOM 就降到 1训练轮数epochs100新手够用追求质量再上 300执行训练在0-前置选项卡选中你的音频文件夹点击一键切片→训练→推理。界面会自动完成三件事切片提取特征与 F0、训练模型、生成索引。参考耗时10分钟数据在 RTX 3060 上约 1~2 小时。验证结果看到以下产出即算跑通终端出现 Training is done 提示logs/目录下出现该实验的训练日志和各轮 checkpointassets/weights/目录下出现最终.pth模型文件如my_model_e100_s100.pth几十 MB切到2-推理选项卡选中该音色转换一段音频能听到目标音色即为成功 两条使用路线离线音频转换与实时变声离线转换2-推理选项卡操作路径选中音色模型 → 上传音频 → 设参数 → 点转换。关键参数参数推荐值作用F0 音高f0up_key0原调12 升八度-12 降八度F0 提取方法RMVPE比 harvest 更准更快索引比率index_rate0.3~0.5越大越贴近原音色过大易发毛保护清辅音与气息音protect0.33防止高音处音调异常重采样输出0同输入想提升音质可设为 44100想用命令行处理调用 tools/infer_cli.pypython tools/infer_cli.py --input_path in.wav --model_name my_model --f0method rmvpe批量处理则用tools/infer_batch_rvc.py。实时变声Windows 双击go-realtime-gui.bat选择麦克风和输出设备即可边说边变端到端延迟约170ms使用 ASIO 输入输出设备可压到90ms依赖声卡驱动支持要点缓冲区选小一点、关无关后台程序延迟偏高优先换 ASIO 驱动️ 效果调优三档路线能跑、更好、最佳一次只动一个变量听完效果再进下一档。第一档能跑10分钟数据 100 轮训练参数全部保持默认产出音色基本像细节略有毛边可接受第二档更好数据加到 30~60 分钟训练轮数提到 300索引比率调到 0.5protect 保持 0.33产出咬字更干净长句稳定性明显提升第三档最佳数据堆到 100 分钟以上的高质量录音在ckpt处理选项卡用 ckpt-merge 做模型融合混合两个音色的优缺点产出接近原音色的翻唱级效果 四个真实落地场景AI 翻唱UVR5 分离歌曲的人声和伴奏 → 训练目标歌手模型 → 把人声部分转换音色 → 与伴奏重新合成。视频解说训练一个固定解说音色整期系列视频统一用这一个声音配音一致性远好于每期换人录。直播实时变声go-realtime-gui.bat ASIO 声卡说话即变声延迟约 90ms。角色配音同一句台词用 F0 音高 12 / -12 生成高低两个版本快速产出不同角色的对白。️ 排查速查表训练与推理的高频问题现象可能原因处理训练中途崩溃、显存不足批大小过大批大小降到 1采样率降到 32k推理输出无声F0 提取失败或输入含 BGM换 RMVPE 提取确认输入是干净人声声音毛糙、机械感重数据量或轮数不足数据加到 30分钟轮数加到 300音调过高、鼻音重F0 音高调得过高f0up_key 降回 0 或 -12实时变声延迟高驱动缓冲区太大换 ASIO 设备调小缓冲区报错但日志无明确信息路径含中文或特殊字符把项目移到纯英文、无空格的目录更多问题查 中文FAQ英文对照见 English FAQ。 进阶入口API 与可修改的关键文件api_240604.py最新版对外 APIapi_231006.py为兼容旧版用法以文件内示例为准configs/config.py全局配置改批大小、保存策略等infer/modules/train/train.py训练主逻辑infer/lib/infer_pack/models.py模型结构定义✅ 收尾行动清单按系统表格装好依赖双击go-web.bat或python infer-web.py打开界面准备 10 分钟干净人声放进assets/abs/在0-前置选项卡一键切片→训练→推理确认assets/weights/里出现.pth模型文件到2-推理转换一段音频索引比率 0.5听效果有余力再跑go-realtime-gui.bat体验实时变声从 10 分钟录音开始听到第一段转换结果再按更好档的参数逐项调整即可。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表