ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

MOSS-VoiceGenerator 角色声音设计指南:如何用一句描述为动漫与有声书创造独一无二的人声

MOSS-VoiceGenerator 角色声音设计指南:如何用一句描述为动漫与有声书创造独一无二的人声 MOSS-VoiceGenerator 角色声音设计指南如何用一句描述为动漫与有声书创造独一无二的人声【免费下载链接】MOSS-TTSAn open-source model family for long-form speech, dialogue synthesis, voice design, sound effects, and real-time streaming TTS项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTSMOSS-VoiceGenerator是开源项目 MOSS-TTS 家族中的声音设计Voice Design模型无需任何参考音频只需用一句话描述疲惫沙哑的老年声音或傲慢的年轻女声它就能生成带情绪的、接近真人质感的角色人声。这对动漫配音、有声书、游戏 NPC 等场景来说意味着你可以完全写出一个角色该有的声音。零参考音频用文字直接设计声音传统 TTS 想换一种音色你得先找到一段合适的参考音频——找素材本身就是一件麻烦事。MOSS-VoiceGenerator 走的是另一条路零样本声音设计Zero-shot Voice Design。传统 TTS 配音流程MOSS-VoiceGenerator 流程找/录参考音频 → 克隆音色 → 调参写一段文字描述 → 直接生成它的三大核心能力高表现力情感演绎音调、语速、情绪可以自然切换而不是一味平铺直叙️拟人级自然度带有真实的呼吸、停顿和口语细节中英双语中文和英文都能高质量合成。最快上手方式一键启动网页界面项目内置了基于 Gradio 的图形化应用新手不用读代码也能玩起来。启动脚本是 clis/moss_voice_generator_app.py在终端执行python clis/moss_voice_generator_app.py界面提供示例库 自定义输入两种模式。左侧下拉框预置了 8 个官方示例来自 assets/text/moss_voice_generator_example_texts.jsonl例如有声书向撕心裂肺声泪俱下的中年女性 →皇上臣妾做不到啊‍☠️动漫向粗犷急躁的海盗船长语速快语调低沉而充满命令 →快点把那箱金币搬过来播客向热情的美食节目主持人语调生动活泼充满专业精神选好示例后填入要合成的文本点击生成即可。想要专属角色就在instruction风格描述里写你自己的设定text里写台词——模型会严格按照描述演绎。如何写出好的人声描述instruction字段是灵魂官方建议覆盖这几个维度情绪、语速、音调、嗓音特质、口音。技巧清单可直接套用角色身份 情绪状态如疲惫沙哑的老年声音缓慢抱怨带有轻微呻吟情绪转折进阶如英文示例Mom scolding kid... then seeing he cut himself, shifting to concern——一段话里完成从生气到心疼的切换场景化人设如酒馆老板粗犷、热情、略带沙哑的欢迎语气适合游戏与广播剧。写完后建议先拿 1~2 句短句试声确认音色方向对了再批量合成整段台词。底层架构指令与音色统一建模MOSS-VoiceGenerator 基于MossTTSDelay架构1.7B 参数。它的巧妙之处在于把声音描述指令和待合成文本拼接在一起做 token 化输入由同一个大模型统一完成音色设计 风格控制 内容合成而不是多个模块拼接。这种指令-音色对齐的建模方式让模型学会了文字描述 → 声学特征的对应关系这正是它能凭空设计音色、不依赖参考音频的原因。架构细节可参阅 moss_tts_delay/README.md。实测表现胜率全面领先在 160 条覆盖多种声音风格的内部测试中MOSS-VoiceGenerator 于整体偏好、指令遵循、自然度三个维度击败了所有支持零预设音色、自定义文本的对比 TTS 系统从上图可以看到对比 Qwen3-TTS-vd、MiniMax Voice Design、MiMo-Audio-7B-Instruct 三个对手时胜率均在 50% 以上其中整体表现对 MiMo-Audio-7B-Instruct 达到63.1%的最高胜率。⚙️调参提醒官方强调该模型对解码超参数较敏感推荐参数为audio_temperature1.5、audio_top_p0.6、audio_top_k50、audio_repetition_penalty1.1详见 docs/moss_voice_generator_model_card.md新手直接沿用默认值即可。适合哪些场景有声书为不同角色各写一条人设描述一本多角的作品音色调性统一动漫/广播剧海盗、公主、反派……任何只有设定没有配音演员的角色都能出声游戏配音NPC 对白、角色技能语音的批量生产对话助手/角色扮演 Agent作为其他 TTS 系统的声音设计层先设计出音色再供下游使用。如果你有特定角色的定制需求比如某语种、某类角色还可以参考 moss_tts_delay/finetuning/ 下的微调教程进一步训练。关键文件速查内容路径模型卡片含快速开始代码docs/moss_voice_generator_model_card.mdGradio 演示应用clis/moss_voice_generator_app.py官方示例文本中英 8 条assets/text/moss_voice_generator_example_texts.jsonlMossTTSDelay 架构说明moss_tts_delay/README.md微调教程moss_tts_delay/finetuning/一句话总结先写角色再生成声音。MOSS-VoiceGenerator 把配音选角变成了写 prompt这是动漫与有声书创作者值得试试的开源声音设计工具。【免费下载链接】MOSS-TTSAn open-source model family for long-form speech, dialogue synthesis, voice design, sound effects, and real-time streaming TTS项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表