ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

ChatTTS-ui 音色定制:3 步做出自己的专属音色

ChatTTS-ui 音色定制:3 步做出自己的专属音色 ChatTTS-ui 音色定制3 步做出自己的专属音色【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-uiChatTTS-ui 是一个本地网页语音合成工具。本文讲它的音色定制怎么做填一个种子数字就能生成自己喜欢的音色再用音色文件把音色固定下来反复使用还能直接走 API 调用。读完你就能完成这三件事。第 1 步3 步拿到第一个自定义音色读完这节你能在 3 分钟内合成出第一个自己挑的音色。在项目目录执行python3 app.py浏览器自动打开 http://127.0.0.1:9966。在页面的音色值输入框填一个大于 0 的整数如 3000、8888输入文字点合成。换一个数字再试挑一个顺耳的音色的种子值。可选把满意的音色导出为 csv/pt 文件放进 speaker/ 目录以后按文件名直接选用不用记数字。习惯 API 的话直接在请求里填个整数当种子即可。下面的例子用 8888 请求合成跑完会打印返回的 json里面有 wav 文件路径和可下载的 urlimport requests res requests.post(http://127.0.0.1:9966/tts, data{ text: 自定义音色测试, custom_voice: 8888, temperature: 0.3, top_p: 0.7, top_k: 20 }) print(res.json())注意custom_voice要求大于 0 的整数一旦填写就会忽略voice字段。1 分钟搞懂 seed、音色文件和控制符读完这节你能说清楚 seed 数字、.pt/.csv 文件和 prompt 控制符各是干什么的。seedcustom_voice一个整数模型用它推导音色。页面预置的 2222、7869、6653、4099、5099 本质上也是种子值。⚠️ 官方明确提示不同设备同一种子合成声音会有差异同一设备相同种子的音调也可能变化所以重要音色要靠文件固定。音色文件存放在 speaker/ 目录两种格式——.ptPyTorch 张量和.csv一行一个数值。启动时系统会扫描该目录下所有.pt和.csv生成可选音色列表逻辑在 uilib/utils.py 的get_speakers()里。控制符prompt拼在文本里的方括号标记调节说话表现例如[oral_2][laugh_0][break_6]。用 cover-pt.py 转换旧音色文件读完这节你能把旧版本下载的 pt 文件在 0.96 版本里用起来。0.96 版本起 ChatTTS 内核升级旧格式 pt 文件无法直接加载。把类似seed_2155_restored_emb.pt的文件放进 speaker/ 目录然后在项目根目录执行python cover-pt.py。脚本cover-pt.py会把目录下所有以seed_开头、_emb.pt结尾的文件转成新编码转换后文件名以-covert.pt结尾例如seed_2155_restored_emb-covert.pt。跑完脚本会提示你只保留转换后的文件即可。调参数和控制符微调音色细节读完这节你能把音色的稳不稳和表现力调到自己想要的状态。常用 API 字段网页界面里也有对应输入项字段默认值作用custom_voice0大于 0 的整数种子填写后覆盖voicetemperature0.3采样温度越低越稳、越高越有变化top_p0.7核采样范围top_k20候选词数量prompt空控制符串控制符可以任意组合[oral_X]调口腔音感[laugh_X]加笑声[break_X]控制停顿如[oral_2][laugh_1][break_3]。调节顺序建议先固定种子一次只改一个参数试听对比正式内容可以把 temperature 压到 0.1~0.5 区间。想批量备货音色思路是用 ChatTTS 循环不同的种子值对每个种子调用sample_random_speaker()取随机音色再用 torch.save 存成speaker/{seed}.pt逐个试听留掉。抄走两套配方商务讲解与儿童故事读完这节你能直接把参数抄进界面或 API 使用。商务讲解稳、少情绪基础音色预置 2222参数temperature0.2top_p0.7top_k20控制符[break_3]增加适当停顿预期语速节奏稳、音调不飘适合产品与文档讲解儿童故事活泼音色值在 5000~8000 区间挑种子参数temperature0.4增加变化感控制符[laugh_1]加入笑声预期语气起伏明显适合儿童向内容音色加载失败等问题1 分钟修好读完这节你能自行处理最常见的几类报错。音色文件没出现在选择列表确认文件在 speaker/ 目录里且扩展名是 .pt 或 .csv。旧 pt 文件加载不了、声音不对执行python cover-pt.py转成新编码格式。同一种子不同设备或多次运行音色不一致属已知特性重要音色导出成文件固定下来。下载模型卡在 proxy 报错modelscope 不允许走代理下载关闭代理。报缺少spk_stat.pt或path.yaml模型不完整重新下载后复制到报错提示的目录如models/pzc163/chatTTS/asset。下一步打开界面填一个种子值合成一遍把满意的音色存成文件放进 speaker/ 目录。之后可以改.env里的WEB_ADDRESS让局域网设备访问或在脚本里循环调用 /tts 接口批量出片。【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表