
Chatterbox 多语言开源 TTS5 分钟跑通文本转语音与零样本声音克隆【免费下载链接】chatterboxSoTA open-source TTS项目地址: https://gitcode.com/GitHub_Trending/chatterbox7/chatterboxChatterbox 是 Resemble AI 开源的一套 SOTA 级 TTS文本转语音模型家族核心能力是给一段文字它读出来再给 6 到 10 秒人声参考它还能用几乎一样的音色读出来也就是零样本声音克隆。它支持 23 种以上语言也提供低延迟的英文专用版本。适合想快速搭出语音产品、有声内容或多语言配音的开发者以及不想做训练、只想开箱即用的普通用户。能力全景Chatterbox 能帮你做什么你能调用的能力站在你的角度实际拿到什么文本转语音TTS输入文字直接出自然语音不需要任何训练零样本声音克隆一段参考音频即可复刻目标音色无需微调23 语言合成中 / 日 / 英 / 法 / 德 / 西 / 阿拉伯语等一个模型切换副语言标签Turbo文本里写[laugh]、[chuckle]会真的念出笑声语音转换VC把一段已有录音换成另一个人的音色情感与 CFG 调节用exaggeration、cfg_weight两个旋钮控制语气强弱内置 PerTh 水印每条音频带不可感知水印方便溯源和负责任 AI最短路径5 分钟跑通第一句语音先装依赖依赖版本已在 pyproject.toml 中锁定保证环境一致pip install chatterbox-tts如果想改代码用源码方式安装git clone https://gitcode.com/GitHub_Trending/chatterbox7/chatterbox cd chatterbox pip install -e .再跑一段最小可运行代码。英文版自带内置音色不需要参考音频是见到第一个结果的最快路径无 NVIDIA 显卡就把cuda改成cpuimport torchaudio as ta from chatterbox.tts import ChatterboxTTS model ChatterboxTTS.from_pretrained(devicecuda) wav model.generate(Chatterbox is an open-source text-to-speech model.) ta.save(hello.wav, wav, model.sr)几行代码hello.wav就是第一句合成语音。完整可运行版本见 example_tts.py。核心场景深潜场景一一句话克隆任意声音零样本 TTS目标用别人的音色朗读任意新文本。关键调用是给generate传一个audio_prompt_path参考音频建议 6 到 10 秒、干净无噪的人声。model ChatterboxTTS.from_pretrained(devicecuda) wav model.generate( 这是我克隆出来的声音在说话。, audio_prompt_pathref_8s.wav, # 目标音色的参考音频 ) ta.save(cloned.wav, wav, model.sr)你能得到音色高度贴近参考音频的语音适合给虚拟角色配音、做个性化语音助手。场景二一个模型覆盖 23 种语言目标同一套音色做多语言配音。用多语言模型并传language_idV3 是当前推荐的多语言版本。from chatterbox.mtl_tts import ChatterboxMultilingualTTS model ChatterboxMultilingualTTS.from_pretrained(devicecuda, t3_modelv3) wav model.generate(你好这是一个多语言语音合成测试。, language_idzh) ta.save(zh.wav, wav, model.sr)你能得到中 / 日 / 德 / 法 / 西 / 阿拉伯语等 23 种语言代码直接切换适合全球化应用和跨语言本地化。语言代码表见 src/chatterbox/mtl_tts.py 的SUPPORTED_LANGUAGES。场景三实时语音克隆给 Agent 装嘴巴目标低延迟、带真实感的英文对话用 Turbo。它在文本里原生支持副语言标签并把解码从多步压成一步算力和显存占用更低。from chatterbox.tts_turbo import ChatterboxTurboTTS model ChatterboxTurboTTS.from_pretrained(devicecuda) text Hi, Sarah here calling you back [chuckle]. Got a minute? wav model.generate(text, audio_prompt_pathref.wav) # Turbo 需参考音色 ta.save(agent.wav, wav, model.sr)你能得到更省资源、适合实时语音助手和创意叙事的英文模型还能念出[laugh]、[cough]这类声音细节。选型对照表该选哪个模型按需求选不纠结你的需求推荐模型加载方式中 / 日等多语言Chatterbox-Multilingual V3ChatterboxMultilingualTTS(..., t3_modelv3)英文低延迟 AgentChatterbox-TurboChatterboxTurboTTSCPU / 设备端、显存紧张Chatterbox-NanoChatterboxTurboTTS(nanoTrue)英文创作、情感调节Chatterbox 原版ChatterboxTTS单一语言最高质量Single Language Pack对应专项微调模型硬件怎么选直接定device参数设备device 取值说明NVIDIA 显卡cuda首选速度最快Apple M 系列mps可参考 example_for_mac.py纯 CPUcpu优先用 Nano8 核约 3 倍实时踩坑与调优现象 → 原因 → 解决官方在 README.md 的 Tips 里给了几个可以直接照抄的调法现象原因解决中 / 日语带外国口音参考音频语言与目标语言不一致用同语言参考音频或跨语言时把cfg_weight设为0显存不足 / OOM模型偏大换cpu或改用 Nano语速偏快、节奏乱参考说话人语速快把cfg_weight降到0.3左右Mac 上 mps 报错当前 PyTorch 未启用 MPS参考 example_for_mac.py或退回cpu两个核心旋钮的调优方向exaggeration越高语气越夸张、语速越快cfg_weight越低越放飞、节奏更慢更刻意。戏剧化表达用cfg_weight≈0.3exaggeration≥0.7日常场景用默认0.5 / 0.5即可。想确认音频是否 AI 生成可用内置的 PerTh 水印检测import perth, librosa audio, sr librosa.load(hello.wav, srNone) watermark perth.PerthImplicitWatermarker().get_watermark(audio, sample_ratesr) # 输出 0.0无水印或 1.0已加水印生态与可视化入口不写代码也能玩不想写脚本直接跑仓库里自带的 Gradio Web 界面浏览器里输入文字就能听TTS 界面gradio_tts_app.pyTurbo 界面gradio_tts_turbo_app.py语音转换界面gradio_vc_app.py多语言界面multilingual_app.py模型由文本侧的 T3 与音频侧的 S3Gen 拼接而成核心源码分别在 src/chatterbox/models/t3/ 和 src/chatterbox/models/s3gen/需要深入定制时从这里入手。一页速查核心命令pip install chatterbox-tts # 安装 python example_tts.py # 跑官方示例 python gradio_tts_app.py # 启动 Web 界面关键参数参数默认作用language_id按模型多语言模型的语言代码如zhaudio_prompt_pathNone参考音色路径实现声音克隆exaggeration0.5语气夸张度越高越情绪化cfg_weight0.5生成可控性越低越自由t3_modelv2多语言版本v3更稳常用路径官方说明 README.md、示例 example_vc.py语音转换、核心源码 src/chatterbox/。下一步先运行 example_tts.py 听一句默认音色再换成你自己的参考音频跑一次场景一基本就上手了。【免费下载链接】chatterboxSoTA open-source TTS项目地址: https://gitcode.com/GitHub_Trending/chatterbox7/chatterbox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考