ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

RVC快速语音转换指南:10分钟克隆一条专属声线

RVC快速语音转换指南:10分钟克隆一条专属声线 RVC快速语音转换指南10分钟克隆一条专属声线【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI给短视频配音时你突然想要一条完全不同的声线。打开 Retrieval-based-Voice-Conversion-WebUI简称 RVC喂给它十来分钟的干声语音转换就完成了——这个开源项目把语音克隆压缩到了分钟级。项目速览解决的问题用少量干声训练出可模仿特定人声色的 AI 语音模型输入新音频即输出对应音色。技术路线基于 VITS一种神经网络语音合成框架并叠加检索增强——推理时从检索库里匹配音色数据有限时输出也不至于跑偏。与同类方案的差异图形界面驱动不需要命令行训练经验训练数据 10 分钟以内即可见效单卡即可运行。获取代码并按显卡安装依赖克隆项目代码到本地git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI然后进入项目目录cd Retrieval-based-Voice-Conversion-WebUI。按显卡类型安装依赖。NVIDIA 直接用下面的命令A 卡把文件名换成 requirements-dml.txtDirectML 路线Intel Arc 换成 requirements-ipex.txtpip install -r requirements.txt下载预训练权重、音高提取模型和 UVR5 人声分离权重总量数 GB首次使用跑一次即可python tools/download_models.py核心工作流从干声到转换结果准备训练数据录几分钟干净、干燥的语音背景噪声越小越好剪掉长静音段存成 WAV。10 分钟起步数据越充足音色越稳定。一键启动本地训练页面运行下面命令后本地服务启动浏览器会自动打开训练页面python infer-web.py挑选音高提取算法与索引率音高提取算法选 RMVPE。它负责从语音中提取基频f0也就是你听感里的音调出自 Interspeech 2023精度高、速度快还能正常处理哑音段是默认最稳的选择。采样率32k 省显存40k 综合最优48k 追求最高音质。6GB 显存从 40k 开始。训练轮数 total_epoch先给 10~20 轮产物仍有杂音再追加。index_rate索引率控制输出音色有多少来自检索库。训练数据干净、量足时可以调高数据少而杂压到 0.4~0.6。拿不准就调低一些听完再每次加 0.1。跑推理并试听效果训练结束后切到推理页选中生成的模型和索引文件传入任意音频试听。音调不对就动 pitch半音单位男声转女声常用 12 左右音色不准就回调 index_rate循环试听。 在语音聊天里做实时变声实时变声是 RVC 使用频率最高的功能麦克风输入边说话边转换适合语音聊天、直播场景。运行下面命令即可启动python tools/rvc_for_realtime.py关注两个参数threhold是静音阈值设太低会把背景噪声一起转换太高又容易吞掉气声block_time是处理块时长越小延迟越低但太小可能出现断续。模型融合混合两个模型的特征可用tools/trans_weights.py人声伴奏分离则直接用主页面的 UVR5能把训练数据的底噪和伴奏剥掉。⚙️ 按现象调参数常见故障对照表现象可能原因调整方向输出音色不像原主人index_rate 偏低每次加 0.1 对比试听输出里混入输入者音色index_rate 过高或数据噪声大调低 index_rate重新分离训练数据声音发闷、有电流感训练轮数不足或数据底噪高增加 total_epoch换干声训练实时模式延迟高block_time 偏大或 CPU 瓶颈减小 block_time走 GPU 推理训练中途显存爆掉batch_size 过大降到 1采样率改 32k资源指引docs/en/英文文档目录含 FAQ 与训练技巧中文版在 docs/cn/infer/modules/vc/语音转换核心逻辑推理管线与模块参数都在这里infer/modules/train/数据预处理与训练脚本音高提取脚本在 extract/ 下i18n/locale/13 种界面语言含 zh_CN.json 与 en_US.jsonconfigs/config.json运行时配置自动记录你最近一次选中的参数接下来可以做什么用 UVR5 把你喜欢的歌曲重新分离拿提取出的干声训练第二个模型做对比用模型融合混合两条声线验证哪种配比更像目标音色换一种 i18n 界面语言或用 infer_cli.py 做命令行批量推理语音转换只能用于本人声音或在取得声主明确授权后进行不要用它冒充他人或用于其他不当用途。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表