ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Cherry Studio 语音交互完整指南:语音输入输出怎么开启、怎么调优

Cherry Studio 语音交互完整指南:语音输入输出怎么开启、怎么调优 Cherry Studio 语音交互完整指南语音输入输出怎么开启、怎么调优【免费下载链接】cherry-studioAI productivity studio with smart chat, autonomous agents, and 300 assistants. Unified access to frontier LLMs项目地址: https://gitcode.com/GitHub_Trending/ch/cherry-studioCherry Studio 是一款支持 300 模型的桌面端 AI 工作台。除了打字它还能听你说话、用声音回你——也就是语音输入输出语音交互这一对功能。想搞清楚桌面端上语音交互到底怎么开、怎么用好这份指南一次讲完。开车时你还会盯着屏幕打字吗假设你在通勤路上或者手上正干着别的事想问助手一个方案怎么拆。掏手机打字很费劲念出来更自然——这正是 Cherry Studio 语音交互要解决的场景把敲键盘换成动嘴输入和回答都走耳朵和嘴巴。它由两个方向组成语音输入ASR自动语音识别把你说的人话变成文字和语音输出TTS文本转语音把模型的回答念给你听。一次完整的语音交互是这样流转的语音输入输出各自能做什么先划清边界免得期望错位。语音输入能做的对着麦克风说话自动转成文字进入输入框转出来的文字可以二次编辑、补充再发送识别语言跟所选识别模型的能力走中英文模型各有优势语音输出能做的把模型的回答读出来长回答也能完整播放支持播放中暂停、继续、停止适合通勤、做家务这类眼睛不想占用的时刻它不是的不是电话通话你说话时它一般先识别完再进入回答不依赖某家云端黑盒识别和合成都用你自己配的模型从声音到回答四个环节各像什么把整条链路拆开看每个环节都有个贴切的类比。1. 录音像按下录音笔。应用通过麦克风采集你的声音变成一段数字音频流。这一步只负责收不做理解。2. 识别像速记员。语音识别模型ASR听这段音频把它转写成文字。速记员再快也得先听你说完所以输入环节普遍有一点点等待。3. 理解像老搭档。转好的文字进入你选定的对话模型它结合上下文生成回答。这一段和普通打字提问完全一样走的是同一条推理链路。4. 念出来像配音。语音合成模型TTS拿到回答文本把它配音成音频文件再由播放器放出来。三个可配置环节的主流实现对比如下环节干什么常见可选方案语音识别ASR声音 → 文字Whisper 系列、各厂商云端识别接口对话模型理解问题、生成回答Cherry Studio 里你常用的任意 LLM语音合成TTS文字 → 声音厂商 TTS 接口、开源语音模型可以看到识别和合成都是可插拔的换一个供应商的语音模型链路其他部分不用动。上手指南两步配好三分钟上手前提你已经有可用的供应商 API Key。语音功能依赖两类专用模型缺了哪类就少了哪个方向。第 1 步添加语音模型进入「设置 → 模型设置」在对应供应商下添加模型时把「模型类型」选为语音或转录——前者通常用于语音合成后者用于语音识别。这一步只是登记不会产生费用。第 2 步指定给语音功能使用回到「设置」的 AI 相关配置区为语音输入识别和语音输出合成分别指定第 1 步里配的模型。两个方向可以选不同供应商的模型。第 3 步用起来在对话页找到麦克风按钮点一下开始说话说完整句后停止识别出的文字会出现在输入框里改好再发送在回答气泡上点朗读类按钮就能让模型开口。注意事项识别和合成是真实 API 请求会产生少量调用费用敏感账户注意用量首次打开麦克风系统会弹权限申请桌面端请点允许识别语言跟着模型走专挑一个中英俱佳的模型别贪多。让对话更顺的 4 条经验这些来自高频使用场景的体感亲测有效。先挑对场合。通勤、做饭、睡前是语音交互的主场赶时间赶精度的技术细节核对还是打字稳。句子短一点。一口气说 20 字以内识别准确率明显更好长问题拆成两句说。口音和语速不是障碍停顿才是。说错一个词没关系识别完反正能编辑但中间长时间停顿时尽量用嗯……这类词占位避免被判定为说完。网络决定延迟。识别走云端时延迟和网速强相关家里宽带和 4G 外出的体感差距能到秒级。对延迟敏感就挑节点近的供应商。安静环境 离麦 10~20 厘米。风扇、空调的白噪音是识别误伤的头号来源物理上隔远点比什么技巧都管用。常见问题问能不能完全离线用不能。当前语音输入输出依赖供应商的语音模型接口需要联网调用对话模型本身支持本地部署但识别和合成暂不走端侧。问中文识别总夹带英文单词换一版对中英混读训练更好的识别模型试试或者说话时英文词放慢半拍多数 ASR 模型对这种慢速插入的鲁棒性更好。问配了两个语音模型回答念的是哪个以「设置」里为语音输出指定的那个合成模型为准跟对话用的模型无关。两个方向互相独立可以随意搭配。问为什么有时候没声音按顺序排查系统音量、回答气泡上的播放控件是否处于播放中、合成模型的 API Key 是否有效。三者都正常还不响多半是模型返回了空音频换个合成模型即可。小结与展望Cherry Studio 的语音交互把说话→识别→推理→朗读这条链路做成了可自由组合的桌面端能力模型随便换方向和语言都能按场景搭配。上手门槛就是配好两类模型之后动嘴比动键盘快得多。往后的看点有三端侧小模型把识别搬进本地延迟和隐私一起改善流式合成让回答边想边说体感接近真人对话再往后全双工实时通话式的交互模式才是这套链路的完全体。获取源码git clone https://gitcode.com/GitHub_Trending/ch/cherry-studio语音相关模型能力可参考 src/shared/utils/model.ts 中对语音类模型的判定逻辑。【免费下载链接】cherry-studioAI productivity studio with smart chat, autonomous agents, and 300 assistants. Unified access to frontier LLMs项目地址: https://gitcode.com/GitHub_Trending/ch/cherry-studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表