ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Voicebox 教程:把电脑变成开源 AI 声音克隆工作室

Voicebox 教程:把电脑变成开源 AI 声音克隆工作室 Voicebox 教程把电脑变成开源 AI 声音克隆工作室【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voiceboxVoicebox 是一款开源、本地优先的 AI 语音工作室几秒参考音频即可完成零样本声音克隆7 个可切换的本地 TTS 引擎覆盖多达 23 种语言还内置 REST API 与 MCP 服务器让其他应用和 AI 智能体调用你的声音。模型、声音数据与录音全部只留在你自己的机器上。安装后的第一步获取方式三选一桌面端macOSApple Silicon / Intel与 Windows 提供安装包装完直接打开Linux克隆仓库后用docker compose up运行源码git clone https://gitcode.com/GitHub_Trending/voicebox1/voicebox按仓库说明启动前后端硬件方面Apple SiliconMLX/Metal、NVIDIACUDA、AMDROCm都能加速纯 CPU 也跑得动。如何克隆自己的声音 ️新内容想要固定音色重新录音或找人代录成本高。Voicebox 的做法是零样本声音克隆点击界面Create Voice填写名称与语言上传 10~30 秒清晰人声样本也可以现场录音或捕获系统音频并填写参考文本引擎提取声音特征、生成声音嵌入之后用该声音朗读任意文本两条实用建议参考样本要单人、低噪、语速自然同一说话人多种风格随意、正式的多样本能提升稳定性。完全不想录音也可以直接选预设声音Kokoro、Qwen CustomVoice。完整步骤见 voice-cloning.mdx。引擎怎么选本地 TTS 引擎共 7 个其中 5 个支持克隆在声音档案里可随时切换使用场景推荐引擎备注综合质量优先10 种语言Qwen3-TTS 1.7B支持朗读指令语言覆盖最广Chatterbox Multilingual23 种语言含阿拉伯语、印地语英文 行内情绪标签Chatterbox Turbo350M 参数支持 [laugh] [sigh]低配机器、纯 CPULuxTTS约 1GB 显存48kHz 输出700 秒以上长音频TADA 3B长文不跑偏10 种语言长文怎么转有声书 卡点文本一长就被截断或服务端报错整章小说得手工拆段。Voicebox 单次生成文本上限 50,000 字符系统自动在句子边界切分识别缩写与中日韩标点各段独立生成后交叉淡化拼接听感上没有明显接缝。生成走异步队列——提交后就能接着写下一条每次生成保留原始版本可换种子重录多条 Take还能加星标收藏。典型流程把稿件粘进生成框 → 选中克隆好的声音档案 → 开始。模型占显存时可在模型管理里随时卸载。多人播客、有声剧怎么做 对话类内容最难做两个人声靠剪音频拼时序、重叠全靠手动改一句就得重来一遍。Stories 编辑器是一个类似 DAW 的多轨时间线专为这类内容设计每个角色/讲者一条轨道片段可从生成历史拖入、就地生成或上传音频文件在时间线上直接裁剪、拆分不用另开剪辑软件同步播放头整体预览每段剪辑锁定对应的生成版本重生成某一句不会打乱整片多主持播客、旁白加角色的有声书、游戏对话、视频配音、完整阵容的广播剧都能做。细节见 stories-editor.mdx。怎么让声音带情绪、带人设 音色像为什么还是念稿感两层表演能力1. 副语言情绪标签Chatterbox Turbo文本里直接写[laugh][chuckle][gasp][sigh][groan][clear throat]输入框按/会弹出标签插入器出发[laugh]这题简单立刻就活了。2. 八种后期音效移调±12 个半音、混响、延迟回声、合唱/镶边、压缩器、增益、高/低通滤波生成后实时预览。内置 Robotic、Radio、Echo Chamber、Deep Voice 四个预设自己的音效链也能存成预设并设为某声音档案的默认。给任意声音挂人设Voice Personalities 允许在任何档案上写一段不超过 2,000 字的角色描述由应用内置的本地 LLMQwen3驱动Compose 一键生成符合人设的台词或把你写的文本先重写成该角色的口吻再朗读全程不出本机。智能体和应用怎么接入本地声音 卡点Agent 只会回文字想让它们开口又得接一个云端 TTS。Voicebox 是 API-first服务跑在本机 17493 端口只绑 127.0.0.1生成、转写、声音档案列表都是标准 HTTP 接口。一条 curl 就能让脚本用克隆声音朗读curl -X POST http://127.0.0.1:17493/speak \ -H Content-Type: application/json \ -H X-Voicebox-Client-Id: ci \ -d {text:Build complete.,profile:Morgan}MCP 语音接入更简单一条命令接入 Claude Codeclaude mcp add voicebox \ --transport http \ --url http://127.0.0.1:17493/mcp \ --header X-Voicebox-Client-Id: claude-code之后任何 MCP 客户端都能调用voicebox.speak、voicebox.transcribe等工具。在Settings → MCP里可把不同 Agent 固定到不同音色按 X-Voicebox-Client-Id 区分听声辨人朗读时屏幕浮现提示气泡没有偷偷后台发声。见 mcp-server.mdx。怎么用语音全局听写 ⌨️打字累而云端语音输入要把话送出机器。Voicebox 的听写全程本地按住组合键说话、松手即停macOS 默认右 ⌘右 ⌥Windows 为右 Ctrl右 Shift可自定义Whisper 本地转写本地 LLM 可顺带清理口头语结果自动粘贴进你开始说话时聚焦的文本框浮层气泡全程显示录音、转写、清理状态每次听写都存入 Captures 标签页原始音频与文字稿成对保存可重转写、编辑或一键升级为声音样本详见 dictation.mdx。常见问题低配机器能跑吗能。LuxTTS 约 1GB 显存即可纯 CPU 也有实时能力。数据会上传吗不会。模型、声音嵌入、录音、转写都落在本机磁盘服务只监听 127.0.0.1。脚本或 CI 里能用吗可以。POST /speak、POST /generate都是标准 HTTP默认端口 17493接 Agent 走/mcp。23 种语言都能说吗Chatterbox Multilingual 覆盖 23 种Qwen3-TTS 与 TADA 3B 覆盖 10 种Chatterbox Turbo 与 LuxTTS 为英文。【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voicebox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表