ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

5分钟上手KittenTTS:轻量级多语言TTS从安装到语音风格切换

5分钟上手KittenTTS:轻量级多语言TTS从安装到语音风格切换 5分钟上手KittenTTS轻量级多语言TTS从安装到语音风格切换【免费下载链接】KittenTTSState-of-the-art TTS model under 25MB 项目地址: https://gitcode.com/gh_mirrors/ki/KittenTTSKittenTTS 是一个开源文本转语音库模型文件最小仅 25MB纯 CPU 即可运行内置 8 个可切换音色是多语言语音合成场景里上手成本很低的工具。一个场景先要出配音再决定用什么引擎你在给产品页做多语言配音或者只是想快速听一段外语朗读。用商业 API 要申请密钥、算计费、依赖网络用本地大模型几个 GB 显存先摆在那里还要有 GPU。KittenTTS 适合这种场合它基于 ONNX 推理CPU 就能跑完整合成流程最小的 nano 模型磁盘占用只有 25MB。项目官方路线图明确列出了多语言模型当前版本以英文合成为主多语言支持是接下来的方向。KittenTTS 能力盘点语言、音色与模型体积维度内容语言范围当前版本以英文为主多语言合成在官方路线图中内置音色8 个Bella、Jasper、Luna、Bruno、Rosie、Hugo、Kiki、Leo语音风格通过voice参数按调用切换音色与表达方式模型体积25MBnano int8/ 41MBmicro/ 80MBmini运行环境CPU 即可无需 GPU输出 24kHz 音频音色列表与模型加载逻辑在 kittentts/get_model.py 里也可以直接读model.available_voices拿到全部音色名。上手路径装好环境跑通第一段语音再换风格装好环境准备一个 Python 3.8 的独立虚拟环境安装依赖很少主要是 ONNX Runtime 这一类库pip install kittentts跑通第一段语音首次运行会从远端下载模型文件并缓存到本地之后直接走缓存。下面这段代码就能出音频from kittentts import KittenTTS m KittenTTS(KittenML/kitten-tts-mini-0.8) audio m.generate(Hello, this is KittenTTS., voiceJasper) import soundfile as sf sf.write(output.wav, audio, 24000)generate返回 24kHz 的音频数组交给任意播放器就能听也可以用m.generate_to_file直接写文件仓库里的 example.py 是完整可运行的示例。换语言与换风格换音色只需把voice参数换成另一个名字8 个音色里 4 男 4 女Jasper、Bruno 偏男声Luna、Rosie 偏女声。调语速传speed参数1.0 是默认速度1.2 表示快 20%。整个过程不需要改配置文件也不用重新加载模型。调优与进阶这几个参数值得知道语速speed控制整体语速模型配置里带各音色的速度先验不同声音的基础节奏略有差异。音调与音量接口没有单独暴露这两项参数靠音色选择加语速调节或者对返回的音频数组做后处理。风格选择正式朗读和口语化播报建议用不同音色8 个内置声音定位各不相同听一遍再定。自定义训练接口仍处于开发者预览阶段训练专属音色可以走官方支持渠道推理核心在 kittentts/onnx_model.py方便二次开发。 避坑指南三个高频问题的排查顺序合成效果不稳、读中文文本表现差→ 原因当前版本的音素处理按英文流程构建 → 先用英文文本验证流程多语言能力以官方新模型为准。音质明显不如预期→ 原因用了 25MB 的 int8 量化 nano 模型 → 换 41MB 的 micro 或 80MB 的 mini听感差距比较明显。首次运行等待很久→ 原因模型文件要先下载再加载 → 下载完成后有本地缓存第二次运行很快网络中断时重新运行即可续传。机器有 GPU 的话也可以按仓库的 GPU 依赖安装并启用 cuda 后端批量合成时速度更快。结语到这里跑通的门槛已经很低现在打开终端装好依赖执行上面那段代码几分钟内就能拿到第一段音频。下一步把 8 个音色挨个切换一遍风格选择空间就一目了然了。【免费下载链接】KittenTTSState-of-the-art TTS model under 25MB 项目地址: https://gitcode.com/gh_mirrors/ki/KittenTTS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表