ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

10 分钟录音炼出专属变声器:RVC 语音克隆新手三步走

10 分钟录音炼出专属变声器:RVC 语音克隆新手三步走 10 分钟录音炼出专属变声器RVC 语音克隆新手三步走【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是一款开源的变声器与语音克隆工具丢给它 10 分钟目标人声录音它能训练出一个专属音色模型之后任何音频进去都会以这个音色重新输出。适合给视频配音、给游戏角色换声、做翻唱但不想碰音频工程细节的人。全文按「跑起来 → 听得像 → 用得快」三个阶段走走完你手里会有一个能实时说话的变声模型。阶段一 跑起来从一段录音到训练网页 这一阶段的目标只有一个环境装好、网页打开、录音备齐。录音是整个流程里最不可逆的一步所以先录。录音十分钟怎么避开底噪先给结论总时长 10 到 50 分钟最稳妥如果录音干净、底噪低、音色有辨识度5 到 10 分钟也能训出可用模型。录音时盯住三件事环境要静。底噪会直接进模型训练轮次再高也压不下去录音时宁可在安静的房间多录也别在嘈杂环境里凑时长。腔调要有变化。语速、语调、情绪掺着来模型靠这些样本覆盖不同的发音状态只念一种腔调的输出会显得很平。单条别太长。几十秒到一两分钟一段即可过长的录音在切分和内存上都是负担。采样率不用纠结预处理阶段会自动重采样到训练时选定的档位。另外把训练集放在纯英文/数字的路径里路径带空格或中文时ffmpeg 读文件和写清单都可能报错见 docs/cn/faq.md 的 Q1。装环境按显卡挑对依赖文件先把代码拉到本地Python 用 3.12 x64git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python3.12 -m venv .venv激活虚拟环境后按硬件选仓库里对应的依赖文件装CPU 或 A 卡/I 卡用 requirments_cpu_py312.txtRTX 50 系以前的 N 卡用 requirments_cu118_py312.txtRTX 50 系用 requirments_cu128_py312.txt后两者装依赖前先装对应 CUDA 版本的 torch。选错的代价很直接CUDA 版本和显卡对不上训练时才会爆 CUDA error。还有两件事不能省装 ffmpeg切分和重采样都靠它Ubuntu 上sudo apt install ffmpegmacOS 上brew install ffmpeg确认 assets 目录里有预训练底模文件。所谓底模就是官方提前用约 50 小时开源 VCTK 人声数据训好的声学基础模型你的 10 分钟录音只是在这个基础上微调音色所以它必须在本地才谈得上训练和推理。最后启动训练网页python webui.py浏览器会自动打开 webui.py 起的页面默认监听 7865 端口。Windows 用户更省事双击 go-webui.bat 走整合包端口是 7897。4G 显存能不能训练能。官方 FAQQ8的态度很明确4GB 显存的显卡还有救训练、推理都能完成低于 4GB 的 3G、2G 老卡建议直接放弃别折腾。程序启动时会自动读显存做调整——显存不足 4GB 或架构太老的卡会直接落回保守配置。训练时如果 batch size 缩到 1 还报 out of memory那就是显卡确实不够只能换卡或租云 GPU。再提醒一句系统内存切分音频和音高提取是吃 CPU 多进程的物理内存不够时把提取音高和处理数据使用的 CPU 进程数拉低或手动把训练音频切短些FAQ Q14。阶段二 听得像三个训练数字加两下按钮 训练页只动三个数字训练选项卡里值得动的数字就三个其余保持默认参数怎么设为什么总轮数数据有底噪20~30 轮干净且时长足最多 200 轮底噪大的数据训太多轮模型会把噪音也学进去FAQ Q9保存间隔保持默认每 10 轮一个点间隔小才能逐个试听挑最早达标的那个躲开过拟合批次大小用页面默认值OOM 再往下调默认按显存 GB 数的一半估算如 8G 卡取 4是稳定起步值另外两项顺手设好采样率选 48k它对应 v2 底模是 configs/v2/48k.json 所代表的官方质量上限档音高提取算法保持默认的 rmvpeInterSpeech 2023 方案无哑音、速度快、占显存小歌声输入想提速可换 pm。确认训练集文件夹路径、填一个实验名后面找模型全靠它点一键训练。流程会依次跑切分、音高提取、特征提取、训练核心逻辑在 train/train.py日志落在 logs/实验名/ 下。训练完没出现索引再点一次训练索引训练结束后有两个动作必须做。第一是索引它会用 faiss 把训练特征聚成检索库产物是 logs/实验名/ 下 added_ 开头的 .index 文件决定最终声音保留多少训练集的音色。如果一键训练跑完没看到索引多半是训练集太大卡住了索引步骤再按一次训练索引按钮就行FAQ Q2。第二是切到推理页点刷新音色训练完推理里看不到训练集的音色先点刷新还没有再查 logs/实验名/ 下的报错FAQ Q3。推理调音检索特征占比与电音保护推理时真正要摸的滑条是检索特征占比index rate生成时混入从训练集检索到的特征的比例0 到 1单条推理默认 0.75。它的本质是治音色泄露——当底模或输入源的音质高于训练集时输出会往它们那边靠这就是泄露往 1 拉音色完全锚定训练集泄露消失但音质上限被训练集锁死拉到 0不做检索保护音质可能更好泄露问题会回来训练集本身优质且时长足时模型自己就很少引用外部音色这个值反而不重要FAQ Q11。变调是整数半音12 升八度、-12 降八度。protect 滑条默认 0.33范围 0~0.5专门防清辅音和呼吸声被撕出电音输出有电音时往上拉但别拉满 0.5——那是关闭保护。阶段三 用得快批量、实时与验收 ⚡批量转换一个文件夹扔进去不用开网页逐条点。推理页旁边的批量推理选项卡里指定待转换音频文件夹输出默认进 opt 文件夹导出格式可选 wav / flac / mp3 / m4a点转换后目录里每段音频会被逐个处理完。如果要分享模型给的是 weights 文件夹下 60MB 以上的那个 .pth 加上配套 .index 文件别发 logs 下的几百 MB 大文件FAQ Q4。实时变声170ms 延迟怎么来的双击 go-realtime_gui.bat 就能打开实时变声界面realtime_gui.py。官方数据是端到端 170ms 延迟换成 ASIO 输入输出设备可压到 90ms但这非常依赖声卡驱动支持普通 USB 声卡别期待这个数。验收拿没训过的音频听一遍全部跑通后的最后一道关在推理页挑一个保存点模型建议从最早的开始听上传一段录音里没用过的音频做转换重点听音色对不对、有没有泄露或电音。对上了你的专属变声器就成了不对翻 logs/实验名/ 的日志或对照 docs/cn/faq.md 逐条排查。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表