ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Moonshine语音识别命令行速成:4步跑通本地转录

Moonshine语音识别命令行速成:4步跑通本地转录 Moonshine语音识别命令行速成4步跑通本地转录【免费下载链接】moonshineVery low latency speech to text, intent recognition, and text to speech, for building voice agents and interfaces项目地址: https://gitcode.com/GitHub_Trending/moonshine3/moonshineMoonshine是跑在本地设备上的低延迟语音识别ASR库音频直接在本机转成文字不经过云端内容不出你的设备。本教程用官方命令行示例带你完成第一次本地转录并附上参数速查与常见故障处理。Moonshine本地语音识别能做什么Moonshine 的命令行示例把音频转成文字全程在本机完成分两个入口跨平台的 C 转录示例转 WAV 文件和 Windows 麦克风实时转录工具。跟着做完你会拿到一个能直接运行的transcriber可执行文件以及配套的模型和测试音频一份可换模型、可调转录刷新频率的参数速查表编译、模型加载、音频格式三类问题的报错对照清单第一次转录前的准备清单项目位置说明项目源码仓库克隆目录运行git clone https://gitcode.com/GitHub_Trending/moonshine3/moonshine进入moonshine目录预编译库examples/c/download-library.sh自动识别平台解压到examples/c/moonshine-voice/语音识别模型脚本下载至examples/c/medium-streaming-en/同一脚本拉取默认 Medium 流式英文模型测试音频test-assets/two_cities.wav脚本会顺带拉进示例目录也可用 test-assets/ 里任意 16-bit PCM WAV编译器gLinux/macOS或 Visual StudioWindowsC 示例只依赖 gWindows 麦克风工具需要 VS 工程如何跑通第一次本地转录1️⃣ 在示例目录运行下载脚本一次性备齐预编译库、模型和测试音频cd examples/c ./download-library.sh2️⃣ 编译转录示例Linux 命令macOS 需在末尾补-framework CoreFoundation -framework Foundationg transcriber.cpp -Imoonshine-voice/include -Lmoonshine-voice/lib \ -lmoonshine -Wl,-rpath,$ORIGIN/moonshine-voice/lib -o transcriber3️⃣ 不带参数直接运行默认加载 Medium 流式模型并转录two_cities.wav./transcriber终端会滚出Line started: ...、Line completed: ...等行逐句显示《双城记》的开头内容。Transcriber 命令行参数速查表参数作用示例值-m, --model-path模型目录路径medium-streaming-en-a, --model-arch模型架构0Tiny1Base2Tiny流式3Base流式4Small流式5Medium流式5-w, --wav-path要转录的 WAV 文件Windows 工具省略该参数即进入麦克风模式two_cities.wav-t, --transcription-interval两次转录刷新的间隔秒数C 示例专有0.481-h, --help显示帮助Windows 工具—-a的取值必须与你-m指定的模型一致传错会直接加载失败。两个进阶场景麦克风实时转录与换用测试音频场景 1Windows 麦克风实时转录⚡用 Visual Studio 编译 examples/windows/cli-transcriber/cli-transcriber.vcxproj然后直接运行cli-transcriber.exe不传-w就自动进入麦克风模式终端先打印Listening to microphone...之后当前行文字随说话实时改写CtrlC 退出。场景 2换用仓库里另一段测试音频在examples/c目录执行./transcriber -w ../../test-assets/two_cities_16k.wav预期输出终端同样逐句出现《双城记》开头文字该文件是 16kHz 版本音频可与默认音频对比识别节奏的差异。运行报错后的常见问题与解决现象运行时报cannot open shared object file: libmoonshine.so。原因运行时找不到动态库。解决编译命令保留-Wl,-rpath,$ORIGIN/moonshine-voice/lib或运行前先export LD_LIBRARY_PATH$(pwd)/moonshine-voice/lib。现象Only 16-bit PCM WAV files are supported。原因音频是浮点或 24-bit 格式。解决先转换ffmpeg -i in.wav -ar 16000 -ac 1 -sample_fmt s16 out.wav。现象模型加载失败提示模型目录缺文件。原因流式模型是一组文件多个.ort加tokenizer.bin、streaming_config.json下载不完整。解决重跑./download-library.sh检查-a与模型目录是否匹配。现象Windows 麦克风模式没有任何输出。原因默认录制设备未选中或麦克风被占用。解决在 Windows 声音设置里确认默认录制设备并关掉其他占用麦克风的程序。下一步想换语言或对比精度docs/models/available-models.md 列出了全部模型与准确率想试文本转语音同方式编译 examples/c/text-to-speech.cpp用--asset-root指向core/moonshine-tts/data需要词级时间戳见 docs/word-level-timestamps.md【免费下载链接】moonshineVery low latency speech to text, intent recognition, and text to speech, for building voice agents and interfaces项目地址: https://gitcode.com/GitHub_Trending/moonshine3/moonshine创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表