ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Saymore:口述整理后落到任意输入框

Saymore:口述整理后落到任意输入框 我是 Saymore 的作者。做这个项目的原因不复杂我说话比打字快但说出来的内容没法直接用。脑子里想的是完整句子落到键盘上要一个字一个字敲换成语音屏幕上又会留下嗯“那个”就是说和半句改口。清理这些碎片的时间往往比重新打一遍还长。所以我想要的不是把声音变成文字而是一条能走完的路径开口、识别、整理、落到光标处中间不用再做搬运和删改。Saymore 就沿着这条路径做定位是 Windows 上的本地中文语音输入与口述整理工具。一段口述要经过几段才算真的能用口语和书面语之间隔着几件事填充词、重复词、说到一半改口、缺少标点和断句。只做识别这些都会原样留在输入框里。Saymore 的做法是在识别之后加一道整理再把结果写进当前光标位置。这里有个取舍识别、整理、术语和历史热词都在本机跑不是把你说的话传到远端再返回结果。代价是首次使用需要联网下载约 1.5 GB 的模型之后就在本机运行。整理这一段四种方式对应四类场合整理方式是可选的不同的选择决定文字最后长什么样。轻度整理只做减法去掉口水词和重复词纠错补标点尽量保留你原本的说话节奏。适合即时消息、评论、聊天这类不需要太正式的地方。比如口述那个这个接口的返回呃我看了好像那个字段少了一个。轻度整理后大致是这个接口的返回我看了好像字段少了一个。口语的松弛感还在但碍眼的碎片没了。深度整理换的是表达方式把口语收成书面语适合写文档、说明和总结。同一句话深度整理后可能变成查看后发现该接口的返回结果中缺少一个字段。“它会把然后”就是说这类连接词压掉把松散的句子收拢。这里有个容易被忽略的细节整理是按整段做的不是逐句改完再拼回去。前后语气和断句能保持一致段落才立得住。邮件整理是单独的一类场景。把光标放进邮件正文框口述嗯张工那个部署文档我更新了然后麻烦你有空看一眼有问题周五前告诉我谢谢。整理后会更接近邮件正文的样子口水词被去掉标点和收尾结构补上。适合不想打字但要写工作邮件的人。此外还有 00 后风格整理以及本机运行的术语和历史热词。这两项与本文主题关系不大这里不展开。落字这一段光标在哪就在哪说很多语音工具的问题不在识别而在落点转写完的文字躺在自己的窗口里你还得复制、切回去、粘贴。Saymore 走的是另一条路。把光标点进任意输入框直接说话整理后的结果落在光标处不用在两个窗口之间切换。浏览器里的在线文档、团队的即时通讯窗口、笔记软件、代码编辑器里的对话框都是同一个动作注意力留在当前应用输入交给说话。开发场景也一样。在编辑器里给 AI 编程助手提需求把光标放进它的输入框口述帮我写个函数输入是用户 ID 列表返回去重结果然后按字母排序。整理后落进去再交给助手。省下的不是识别那一步而是说完还要手动删口头禅、顺手改语序的那一步。少碰键盘这一段唤醒词加语音命令如果每次都要按快捷键键盘其实没被放下。Saymore 可以常驻后台听到唤醒词才开始录音默认唤醒词是小咪可以改。平时它只在后台等着不会一直收音。再往后是语音命令说发送执行落字说回退删词说清空清屏说休眠下线。这几条命令和唤醒词连起来才是一条不碰键盘的完整流程——用说话开始用说话输入用说话控制输入框里的动作最后用说话结束。比如一段话说完了发现措辞不对说回退删掉重说想整段作废说清空暂时不用了说休眠。这些都是输入过程中很自然的动作用嘴说比伸手找键更顺。和别的做法比差别在哪系统自带的语音输入、各类语音输入法、专门的转写工具都在解决声音到文字的某一段。有的听写准确度高有的转写长音频更强有的和操作系统结合得更紧。Saymore 的区别只在流程衔接上识别之后立刻整理整理之后直接落到当前光标整理方式可以按聊天、文档、邮件切换还能用唤醒词和语音命令减少按键。它不是会议转写工具也不是手机输入法。选哪个取决于你更在意流程里的哪一段。已知限制以及不适合的人先把限制讲清楚目前仅支持 Windows具体是 Windows 10/11 x64首次使用需联网下载约 1.5 GB 模型安装包未签名Windows 可能弹出安全提示普通 CPU 可以运行有 4 GB 显存 GPU 可以加速。不适合的人也很明确主要用 macOS 或 Linux 的人希望装完即用、不想等模型下载的人对未签名安装包比较敏感的人只需要手机端语音输入的人。如果你只是偶尔听写一次也不介意手动删几个嗯、那个系统自带的工具可能就够用。代码和下载项目是开源的仓库在 https://github.com/frankzch/Saymore 安装包在 https://github.com/frankzch/Saymore/releases 。有反馈或想改唤醒词、整理方式这类设置可以到仓库里提。利益相关作者参与 Saymore 项目。
返回列表