ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

VoiceCraft 实操指南:3步克隆声音、5步改掉录音里的错句

VoiceCraft 实操指南:3步克隆声音、5步改掉录音里的错句 VoiceCraft 实操指南3步克隆声音、5步改掉录音里的错句【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraft做播客的人大概都经历过这种情况整期录完发现中间一句话读错了想单独补录又对不上原声的音色和语速。VoiceCraft 就是为解决这类问题开源的语音编辑与零样本语音合成工具基于神经编解码器的方案只需几秒参考音就能模仿陌生声音核心代码在 models/voicecraft.py。三个能力各管一摊事改一段话而不重录Edit 模式只替换音频里指定时间段的词前后内容原样保留适合播客、课程视频里改错字、改口误。用几秒参考音合成新句子TTS 模式零样本语音克隆把参考音的音色迁移到你新写的文本上适合配音、有声书试读。整篇长文转语音Long TTS 模式按行或按句切分长文本逐段生成某一段不满意可单独重跑适合把文档、书稿整篇做成音频。最短启动路径本地部署是主路径仓库拉下来后装好依赖即可git clone https://gitcode.com/GitHub_Trending/vo/VoiceCraft cd VoiceCraft pip install -r gradio_requirements.txtpython gradio_app.py浏览器打开http://127.0.0.1:7860就进入操作界面。不想手动配环境的用户可以用仓库自带的 Docker 流程docker build后运行./start-jupyter.sh或start-jupyter.bat依赖细节见 environment.yml。首次点击 Load models 时会自动下载预训练权重存到pretrained_models/目录。此处配截图模型加载区5步完成一次语音修改在 Model 选择里确认 VoiceCraft 模型推荐 830M_TTSEnhancedWhisper 后端选 whisperX点击Load models等待进度结束。上传待编辑的音频WAV或直接用仓库示例 demo/5895_34622_000026_000002.wav点击TranscribeOriginal transcript 框会填出带词级时间戳的文本。把 Mode 切到Edit勾选Smart transcript——这样你只需写替换后的句子系统自动拼接前后原文。在 First word to edit 和 Last word to edit 两个下拉框里框住要改的词语时间滑杆会自动跟随也可以拖动 Edit from/to time 手动微调边界。在 Text 框输入新句子点击RunOutput Audio 出现修改后的完整音频前后段落音色不变。边界词的取舍整词替换还是半词替换由 Edit word mode 控制编辑段两侧默认留 0.08 秒 margin。用3秒参考音克隆声音上传 3~10 秒清晰无背景音的 WAV 作为参考点击Transcribe。Mode 选TTS勾选 Smart transcript拖动 Prompt end time 滑杆决定取参考音的前几秒当音色来源也可以直接用 Last word in prompt 下拉框定位到某个词。在 Text 框写要合成的文本点击Run即可得到用参考音音色朗读的整句。把长文档整篇合成语音Mode 选Long TTS在 Split text 里选 Newline按换行切分或 Sentence按句切分。Smart transcript 开启时每行直接写要生成的内容即可关闭时则每行需要以 prompt 文本开头。点击Run句子逐条生成并拼接成完整音频耗时较长耐心等完。界面会列出每句的编号选中不满意的句子点Rerun只重生成那一句再替换进总音频无需整篇重来。参数速查这些参数都在界面下方的 Generation Parameters 折叠区默认值可用生成效果不理想时再动speech rate语速数值越大声速越快底层是并行生成多条候选取最短TTS 增强模型取 1~2 即可一般 3~5。stop_repetition重复抑制生成结果出现长静音时降到 2 或 1-1 为关闭。seed随机种子默认 -1 表示不固定对某次结果满意后记下种子可复现。temperature采样温度官方建议保持 1 不要动。top_k采样截断默认 40可试 20、30。top_p保持 1不做核采样。kvcache显存紧张时设 0推理会变慢。codec_audio_sr / codec_sr / silence tokens编解码器内部参数保持默认。出问题了先看这里现象结果里有长段静音或重复音→ 可能原因重复抑制不足 → 把 stop_repetition 从默认 3 降到 2 或 1 再跑一次。现象语速明显偏快或偏慢→ 可能原因speech rate 与文本长度不匹配 → 长文本建议 3~5短句子降到 1~2。现象音色不像参考音→ 可能原因参考音频短且有噪声或 prompt 边界切在换气处 → 换一段 3~10 秒的干净录音或调整 Last word in prompt 位置后重跑。现象模型加载失败或卡住→ 可能原因首次运行需联网下载权重 → 检查网络显存低于 8GB 时加载 830M 模型容易失败可先试 330M 系列。收尾想深入的地方VoiceCraft 覆盖了改错句、克隆声音、长文转语音三件事界面之外还有脚本级用法。想读代码可以从 inference_speech_editing_scale.py 和 inference_tts_scale.py 两个推理入口看起想训练或微调模型则参考 z_scripts/ 下的 e830M.sh 与 e830M_ft.sh配套数据说明在 RealEdit.txt。【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraft创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表