ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

FunASR Android部署实战完整指南:手机实时语音识别三步搞定

FunASR Android部署实战完整指南:手机实时语音识别三步搞定 FunASR Android部署实战完整指南手机实时语音识别三步搞定【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR这篇文章解决一个很实际的问题手机上怎么快速做出实时语音识别。方案是借助 FunASR 的 Android 示例应用按住说话屏幕实时出文字。先说清一个关键事实识别模型并不跑在手机里手机只负责录音语音识别在服务端完成。下面按顺序把两端都搭起来。手机和识别服务之间用 WebSocket 连起来整条链路只有三个角色。手机把 16kHz 的录音按块通过 WebSocket 发给服务器服务器跑 FunASR 的 2pass 服务先由流式小模型出初步结果再由离线大模型对整句纠错并补上标点结果实时回传到手机。换句话说这是远程识别不是本地部署对手机硬件要求很低。第一步装 Docker已有就跳过️这一步只做一件事拉官方安装脚本跑一遍让服务器具备 Docker 能力全程几分钟。跑完之后命令行里应该能直接用 docker。已经装好的话直接进第二步。curl -O https://isv-data.oss-cn-hangzhou.aliyuncs.com/ics/MaaS/ASR/shell/install_docker.sh sudo bash install_docker.sh验证很简单docker --version能打印出版本号这步就算完成。第二步拉镜像启动 FunASR 容器这一步干两件事把 FunASR 实时识别镜像拉下来并启动容器同时在宿主机上留一个模型目录容器重建时模型文件也不丢。三条命令里两个关键参数先看懂-v把本地 models 目录挂进容器用来存放模型文件-p 10096:10095把容器内服务端口映射到宿主机 10096。sudo docker pull registry.cn-hangzhou.aliyuncs.com/funasr_repo/funasr:funasr-runtime-sdk-online-cpu-0.1.13 mkdir -p ./funasr-runtime-resources/models sudo docker run -p 10096:10095 -it --privilegedtrue \ -v $PWD/funasr-runtime-resources/models:/workspace/models \ registry.cn-hangzhou.aliyuncs.com/funasr_repo/funasr:funasr-runtime-sdk-online-cpu-0.1.13这条跑完你会直接进容器内部终端不用重启就能继续下一步。第三步启动 2pass 实时语音识别服务这才是真正干识别的服务。启动脚本里模型路径都有默认值Paraformer 大模型 FSMN VAD 标点模型默认用法只需指定模型存放目录和热词文件。首次运行会自动下载几个 GB 的模型耐心等。cd FunASR/runtime nohup bash run_server_2pass.sh \ --download-model-dir /workspace/models \ --hotword /workspace/models/hotwords.txt log.txt 21 日志先出现模型下载进度完成后会打印端口监听信息。默认端口 10095对应宿主机 10096看到这一行服务就绪。安装 Android 应用填上服务器地址拿到应用有两条路。第一条源码编译git clone https://gitcode.com/GitHub_Trending/fun/FunASR用 Android Studio 打开仓库里的runtime/android/AndroidClient工程真机直接 Run 或者导出 APK 都行。第二条直接装现成的 APK 包省掉编译环节。源码入口在 Android 示例代码 目录。界面很简单一个按钮加一块结果显示区。第一次打开会要求填识别服务地址写上服务器 IP 加端口端口就是前面端口映射的 10096。之后想换服务地址、改热词菜单栏随时能调。使用流程一句话按住按钮开始识别松开结束结果实时显示在界面上。跑通之后换模型、改端口、配热词三个高频问题⚙️这三个调整都发生在服务启动参数上不用动代码换模型给--model-dir和--online-model-dir指定不同模型路径。online 模型负责低延迟初结果offline 模型负责纠错。改端口启动参数加--port同时记得改容器的-p映射和手机上填的端口三处保持一致。配热词编辑--hotword指向的文件每行一个词专有名词识别率立竿见影。顺带解释下为什么叫 2pass流式模型先实时给第一版结果离线大模型再对整句纠错准确和速度都顾到了。想接其他设备或系统仓库里还有各语言客户端Python 客户端示例、C 示例、Java 客户端示例、C# 客户端示例。参数细节都在 在线SDK文档 里写清楚了。手机端管录音服务端管识别中间用 WebSocket 打通思路想通之后接什么设备都是同一套打法。入口在线SDK文档 · Android 示例代码【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表