ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

sherpa-onnx v1.10.45 发布:全面支持 FireRedAsr 语音识别模型,语言绑定一次补齐

sherpa-onnx v1.10.45 发布:全面支持 FireRedAsr 语音识别模型,语言绑定一次补齐 sherpa-onnx v1.10.45 发布全面支持 FireRedAsr 语音识别模型语言绑定一次补齐【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnxsherpa-onnx v1.10.45 的最大亮点是把 FireRedAsr 语音识别模型整体接进了框架这个基于注意力机制的端到端AED模型被导出为 ONNXC、Python、C#、Swift 等各语言的 API 也一并补齐顺带还修了 Go 绑定和 RTF 计算两处容易被忽略的问题。如果你正在找一个新的离线中英文识别方案或者已经在用 Go API这个版本值得看一眼。FireRedAsr 接入做了什么坦白说支持一个新模型这件事拆开看并不神秘先把模型导出成 sherpa-onnx 认识的格式再让离线识别器系统认识它。这次走的就是这条路线——FireRedAsr 的 encoder、decoder 被导出为 int8 量化的 ONNX 文件模型包名是 sherpa-onnx-fire-red-asr-large-zh_en-2025-02-16里面还有配套的 tokens.txt 词表文件。量化权重对边缘设备上的推理速度影响不小而包里附带的四川、天津、河南等口音示例音频也方便你到手后直接验证方言场景。在框架内部这个模型走的是统一的离线识别器体系Python 侧通过 from_fire_red_asr 创建识别器传入 encoder、decoder、tokens 三个路径就行和框架里已有的其他离线 ASR 模型交互方式一致没有额外的学习成本。sherpa-onnx 的 Web 演示页面支持上传文件和实时录音两种识别入口识别服务是通用底座新模型接入后同样可以挂到这套链路里使用。FireRedAsr 各语言 API 覆盖情况 这次的语言绑定是成批补齐的大致可以分三层看核心与系统级C、C、Python桌面与服务端C#、Go、Pascal、JavaScriptnode-addon移动端与浏览器SwiftiOS、Java/KotlinAndroid、Dart、JavaScriptWebAssembly每类绑定都配了可直接运行的示例文件不需要通读 C 核心代码就能开工。如果你的项目恰好基于上述某个技术栈基本可以照抄对应示例再改参数。两处容易忽略的修复Go 绑定与 RTF 计算 第一个是 Go 绑定的 bug。之前某些情况下创建 Go 实例会返回成功但底层 C 结构体其实创建失败了后续调用就是在无效对象上操作属于潜在的内存访问问题。修复后这类失败会被正确传递出来。用 Go API 的同学建议升级后重新跑一遍初始化流程之前如果遇到过神秘的初始化异常大概率就是它。第二个是实时因子RTF计算里的拼写错误修正。RTF 是衡量语音识别系统实时性能的关键指标这个修复不改变功能但会让性能监控和压测数据更可信对做容量评估的人有意义。上手路径Python 先跑通再扩展到其他语言最轻量的入口还是 Python。先克隆代码仓库git clone https://gitcode.com/GitHub_Trending/sh/sherpa-onnx 然后从项目发布页下载模型包 sherpa-onnx-fire-red-asr-large-zh_en-2025-02-16 并解压照着 python-api-examples/offline-fire-red-asr-decode-files.py 走一遍就能解码包内示例音频看到结果。接下来要进生产环境的话按技术栈挑示例即可C/Ccxx-api-examples/fire-red-asr-cxx-api.cc、c-api-examples/fire-red-asr-c-api.cJavaAndroidjava-api-examples/NonStreamingDecodeFileFireRedAsr.javaSwiftiOSswift-api-examples/fire-red-asr.swiftGogo-api-examples/non-streaming-decode-files/run-fire-red-asr.shPascalpascal-api-examples/non-streaming-asr/fire_red_asr.pas什么样的场景值得为 sherpa-onnx v1.10.45 升级做离线、断网可用的语音识别又想要一个新的中英文模型选项FireRedAsr 就是本次新增的那块拼图量化模型也适合资源受限的边缘设备。已经在用 Go 绑定的话那个内存问题属于必修项。如果你的主力场景是 TTS 或 VAD这次更新与你关系不大可以等下次模型更新时一起升。变更细节可以对照 CHANGELOG.md 里 1.10.45 的条目逐项核对后续版本预计会围绕 FireRedAsr 继续扩展模型规格和对应语言绑定。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表