ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

FunASR ModelScope 预训练模型库(Model Zoo)完全指南:模型目录、许可边界与 AutoModel 实战

FunASR ModelScope 预训练模型库(Model Zoo)完全指南:模型目录、许可边界与 AutoModel 实战 FunASR ModelScope 预训练模型库Model Zoo完全指南模型目录、许可边界与 AutoModel 实战【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR本文基于 model_zoo/modelscope_models.md 的模型目录编写。该目录是 FunASR 在 ModelScope 平台发布的预训练模型清单覆盖语音识别Paraformer、UniASR、Conformer、多说话人识别MFCCA、语音端点检测FSMN-VAD、标点恢复CT-Transformer、说话人验证/日志Xvector、SOND、时间戳预测TP-Aligner与逆文本正则化ITN等全链路能力。读完本文你将掌握每个模型的适用边界语言、参数量、离线/实时、模型许可的核对方法以及如何通过AutoModel与hubms一键加载这些 ModelScope 权重并组合成完整 ASR 流水线。一、目录定位ModelScope 是 FunASR 默认权重仓库FunASR 工具包采用 MIT 软件许可将模型与代码解耦模型选择、checkpoint 格式与运行时分别决策。ModelScope 是AutoModel的默认下载源hub参数默认为ms本目录model_zoo/modelscope_models.md即是该平台发布权重的索引清单与之并列的 model_zoo/huggingface_models.md 则收录 Hugging Face 上的对应权重。两个清单互为补充且都强调同一个原则目录中的模型不等于被所有服务端或导出后端自动支持选型时必须以具体 checkpoint 的模型卡为准。正式使用前建议按以下顺序建立认知闭环模型选型先读 docs/model_selection.md按业务诉求多语言、普通话转写、流式、长音频、说话人分离定位模型族SDK 契约再读 docs/python_api.md 与 docs/tutorial/README.md掌握AutoModel的构造参数、generate()返回结构与可选组件VAD/标点/说话人的配置方式部署边界最后对照 docs/deployment_matrix.md 选择 Python API、OpenAI 兼容服务、运行时 WebSocket、ONNX/C 等落地路径。二、模型许可协议目录 ≠ 统一授权这是使用 Model Zoo 前必须厘清的边界原文强调三点FunASR 工具包本身采用 MIT 软件许可但模型权重是单独的许可标的使用或再分发前必须检查具体 checkpoint 的模型卡、许可文件及 revisionFunASR 模型许可协议仅适用于发布条款明确采用该协议的模型不能想当然套用于目录中的全部条目第三方模型保留原作者归属与各自的模型许可典型例子是 OpenMOSS 发布的 MOSS-Transcribe-DiarizeApache-2.0其集成指南见 docs/moss_transcribe_diarize.md。从仓库实现看这一边界同样反映在加载逻辑中AutoModel通过 funasr/download/download_model_from_hub.py 下载模型时会读取模型目录中的configuration.json或config.yaml完成配置合并而trust_remote_code默认False——即默认不执行模型自带的远程代码也不自动安装模型目录下requirements.txt中的依赖需要用户显式开启并先审查文件内容。这与模型许可需逐个核对的哲学一致仓库只负责加载授权与代码审查责任在用户侧。三、模型选型速查先定任务再定模型族参考 docs/model_selection.md 的决策表ModelScope 目录内的模型可按任务快速对齐业务需求首选模型族关键边界多语言 情感/事件标签可 CPU 跑SenseVoice-Small标签是模型输出不代表说话人身份普通话生产级转写Paraformer-Large离线与流式 checkpoint 推理契约不同长音频 说话人分离一次请求出结果MOSS-Transcribe-Diarize第三方 OpenMOSS 模型无需外接 VAD实时字幕 / 客服流式Paraformer-online / UniASR 在线版面向长连接流式会话普通话转写 字级时间戳 / 热词Paraformer含 SeACo/上下文热词版热词为上下文偏置非强制改写英文字幕 / OpenAI API 兼容路由Paraformer-en与paraformer-zh别名目标不同多说话人会议转写MFCCA输入 ≤20s、通道 ≤8检测/后处理组件FSMN-VAD、CT-Transformer、Xvector、SOND、TP-Aligner、ITN各组件职责单一不越界替代下文各节按原目录顺序逐一展开每个模型族的完整清单与使用要点。四、语音识别模型4.1 Paraformer 家族FunASR 的旗舰非自回归 ASRParaformer 是 FunASR 的核心非自回归NAT识别器目录内按规模 × 语言 × 能力扩展组合出完整矩阵模型ModelScope ID / 名称语言训练数据词表参数量离线/实时备注Paraformer-largeiic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-pytorch中英阿里巴巴语音数据 60000h8404220M离线输入 wav 时长 ≤ 20sParaformer-large 长音频版iic/speech_paraformer-large-vad-punc_asr_nat-zh-cn-16k-common-vocab8404-pytorch中英60000h8404220M离线内置 VAD标点可处理任意长度输入Paraformer-large-en 长音频版damo/speech_paraformer-large-vad-punc_asr_nat-en-16k-common-vocab10020英文50000h10020220M离线任意长度英文输入Paraformer-large-Spkdamo/speech_paraformer-large-vad-punc-spk_asr_nat-zh-cn中英60000h8404220M离线在长音频版基础上增加说话人识别Paraformer-large 热词版damo/speech_paraformer-large-contextual_asr_nat-zh-cn-16k-common-vocab8404中英60000h8404220M离线基于激励增强的热词定制提升热词召回率与准确率输入 ≤ 20sParaformerdamo/speech_paraformer_asr_nat-zh-cn-16k-common-vocab8358-tensorflow1中英50000h835868M离线输入 ≤ 20sParaformer 实时版damo/speech_paraformer_asr_nat-zh-cn-16k-common-vocab8404-online中英50000h840468M实时支持流式输入Paraformer-large 实时版iic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-online中英60000h8404220M实时支持流式输入Paraformer-tinydamo/speech_paraformer-tiny-commandword_asr_nat-zh-cn-16k-vocab544-pytorch中文200h5445.2M离线轻量级支持普通话命令词识别Paraformer-aishelldamo/speech_paraformer_asr_nat-aishell1-pytorch中文AISHELL 178h423443M离线学术基准模型ParaformerBert-aishelldamo/speech_paraformerbert_asr_nat-zh-cn-16k-aishell1-vocab4234-pytorch中文AISHELL 178h423443M离线学术基准模型Paraformer-aishell2damo/speech_paraformer_asr_nat-zh-cn-16k-aishell2-vocab5212-pytorch中文AISHELL-2 1000h521264M离线学术基准模型ParaformerBert-aishell2damo/speech_paraformerbert_asr_nat-zh-cn-16k-aishell2-vocab5212-pytorch中文AISHELL-2 1000h521264M离线学术基准模型使用要点时长边界普通离线版限制输入 wav ≤ 20s需要任意长度时应选择内置 VAD 标点的长音频版-vad-punc-命名即表明其流水线属性说话人信息Paraformer-large-Spk是在长音频功能之上叠加说话人识别但注意其与 docs/speaker_emotion.md 中描述的说话人标签语义一致——输出为录音内的匿名簇标签并非真实身份识别热词热词版基于上下文偏置contextual biasing实现可在generate(hotword...)中传入空格分隔的热词字符串详见下文源码级说明它提升的是召回与准确率不保证强制命中学术版aishell/aishell2 系列用于学术复现与基准对比对应训练配方见 examples/aishell/paraformer 与 examples/industrial_data_pretraining/paraformer。4.2 UniASR流式/离线一体化 2-pass 模型UniASR 采用 2-passtwo-pass架构一个模型同时覆盖流式在线与离线识别目录内覆盖 18 种语言/方言模型语言训练数据词表参数量离线/实时备注UniASRdamo/speech_UniASR_asr_2pass-zh-cn-16k-common-vocab8358-tensorflow1-online中英60000h8358100M实时流式离线一体化UniASR-largedamo/speech_UniASR-large_asr_2pass-zh-cn-16k-common-vocab8358-tensorflow1-offline中英60000h8358220M离线流式离线一体化UniASR Englishdamo/speech_UniASR_asr_2pass-en-16k-common-vocab1080-tensorflow1-online英文10000h108095M实时—UniASR Russiandamo/speech_UniASR_asr_2pass-ru-16k-common-vocab1664-tensorflow1-online俄语5000h166495M实时—UniASR Japanesedamo/speech_UniASR_asr_2pass-ja-16k-common-vocab93-tensorflow1-online日语5000h597795M实时—UniASR Koreandamo/speech_UniASR_asr_2pass-ko-16k-common-vocab6400-tensorflow1-online韩语2000h640095M实时—UniASR Cantonese (CHS)damo/speech_UniASR_asr_2pass-cantonese-CHS-16k-common-vocab1468-tensorflow1-online粤语5000h146895M实时—UniASR Indonesiandamo/speech_UniASR_asr_2pass-id-16k-common-vocab1067-tensorflow1-online印尼语1000h106795M实时—UniASR Vietnamesedamo/speech_UniASR_asr_2pass-vi-16k-common-vocab1001-pytorch-online越南语1000h100195M实时—UniASR Spanishdamo/speech_UniASR_asr_2pass-es-16k-common-vocab3445-tensorflow1-online西班牙语1000h344595M实时—UniASR Portuguesedamo/speech_UniASR_asr_2pass-pt-16k-common-vocab1617-tensorflow1-online葡萄牙语1000h161795M实时—UniASR Frenchdamo/speech_UniASR_asr_2pass-fr-16k-common-vocab3472-tensorflow1-online法语1000h347295M实时—UniASR Germandamo/speech_UniASR_asr_2pass-de-16k-common-vocab3690-tensorflow1-online德语1000h369095M实时—UniASR Persiandamo/speech_UniASR_asr_2pass-fa-16k-common-vocab1257-pytorch-online波斯语1000h125795M实时—UniASR Burmesedamo/speech_UniASR_asr_2pass-my-16k-common-vocab696-pytorch缅甸语1000h69695M实时—UniASR Hebrewdamo/speech_UniASR_asr_2pass-he-16k-common-vocab1085-pytorch希伯来语1000h108595M实时—UniASR Urdudamo/speech_UniASR_asr_2pass-ur-16k-common-vocab877-pytorch乌尔都语1000h87795M实时—UniASR Turkishdamo/speech_UniASR_asr_2pass-tr-16k-common-vocab1582-pytorch土耳其语1000h158295M实时—使用要点UniASR 家族统一以 16k 采样率模型为主适合多语言国际化产品实时版面向流式会话场景与运行时 WebSocket 服务见 runtime/readme.md配合可实现边说话边出结果。注意目录中部分条目标注为流式在线一体化、部分为流式离线一体化两者推理契约不同选型后需对照具体 checkpoint 文档确认输入输出格式。4.3 Conformer经典编码器基线模型语言训练数据词表参数量离线/实时备注Conformerdamo/speech_conformer_asr_nat-zh-cn-16k-aishell1-vocab4234-pytorch中文AISHELL 178h423444M离线输入 ≤ 20sConformerdamo/speech_conformer_asr_nat-zh-cn-16k-aishell2-vocab5212-pytorch中文AISHELL-2 1000h521244M离线输入 ≤ 20sConformerdamo/speech_conformer_asr-en-16k-vocab4199-pytorch英文10000h4199220M离线输入 ≤ 20sConformer 作为经典编码器架构对应实现位于 funasr/models/conformer 与 funasr/models/e_branchformer 等目录训练配方可参考 examples/aishell/conformer。五、多说话人语音识别MFCCA模型语言训练数据词表参数量离线/实时备注MFCCANPU-ASLP/speech_mfcca_asr-zh-cn-16k-alimeeting-vocab4950中文AliMeeting、AISHELL-4、Simudata 共 917h495045M离线输入 ≤ 20s通道 ≤ 8 通道MFCCA 面向会议等多人对话场景一次输入多通道音频完成多人语音内容识别。注意其两个硬性边界单段 ≤ 20s、通道数 ≤ 8。该模型由 NPU-ASLP 发布属第三方贡献条目实现见 funasr/models/mfcca。六、语音端点检测FSMN-VAD模型训练数据参数量采样率FSMN-VADiic/speech_fsmn_vad_zh-cn-16k-common-pytorch阿里巴巴语音数据 5000h0.4M16000FSMN-VADdamo/speech_fsmn_vad_zh-cn-8k-common阿里巴巴语音数据 5000h0.4M8000FSMN-VAD 是极轻量0.4M 参数的端点检测组件只负责定位语音段不转写、不识人。它既是长音频 ASR 流水线的切分器也是流式场景的静音检测器。在AutoModel中作为vad_modelfsmn-vad挂载输出为[start_ms, end_ms]的语音区间列表。对应实现与流式缓冲逻辑见 funasr/models/fsmn_vad_streaming 与 examples/industrial_data_pretraining/fsmn_vad_streaming。七、标点恢复CT-Transformer模型语言训练数据参数量词表离线/实时备注CT-Transformer-Largeiic/punc_ct-transformer_cn-en-common-vocab471067-large中英阿里巴巴文本数据 100M1.1G471067离线大规模离线标点模型CT-Transformerdamo/punc_ct-transformer_zh-cn-common-vocab272727-pytorch中英阿里巴巴文本数据 70M291M272727离线离线标点模型CT-Transformer-Realtimedamo/punc_ct-transformer_zh-cn-common-vad_realtime-vocab272727中英阿里巴巴文本数据 70M288M272727实时VAD 点实时标点CT-Transformer 系列为 ASR 输出添加标点支撑读起来像人话的转写结果。注意其边界它不产生声学时间戳——时间戳需由 TP-Aligner见下文或支持时间戳的 ASR 模型提供。在流水线中以punc_modelct-punc挂载别名指向 Large 版见 funasr/download/name_maps_from_hub.py实现见 funasr/models/ct_transformer 与 examples/industrial_data_pretraining/ct_transformer。八、语言模型Transformer LM模型训练数据参数量词表Transformerdamo/speech_transformer_lm_zh-cn-common-vocab8404-pytorch阿里巴巴语音数据57M8404该语言模型与 Paraformer 系列共享 8404 词表可用于解码重打分rescoring等场景实现见 funasr/models/language_model。九、说话人验证Xvector模型训练数据参数量说话人数备注Xvectordamo/speech_xvector_sv-zh-cn-cnceleb-16k-spk3465-pytorchCNCeleb 1200h17.5M3465中文说话人验证Xvectordamo/speech_xvector_sv-en-us-callhome-8k-spk6135-pytorchCallHome 60h61M6135英文说话人验证Xvector 输出说话人嵌入embedding可用于声纹比对/验证。FunASR 流水线中更常用的说话人嵌入组件是cam对应iic/speech_campplus_sv_zh-cn_16k-common见别名映射其聚类逻辑与匿名说话人标签 ≠ 已知身份识别的边界在 docs/speaker_emotion.md 中有完整说明。实现见 funasr/models/xvector 与 funasr/models/campplus。十、说话人日志DiarizationSOND模型训练数据参数量备注SONDdamo/speech_diarization_sond-zh-cn-alimeeting-16k-n16k4-pytorchAliMeeting 120h40.5M中文说话人日志SONDdamo/speech_diarization_sond-en-us-callhome-8k-n16k4-pytorchCallHome 60h12M英文说话人日志SOND 是端到端说话人日志模型profiles and records直接对多说话人录音输出分段与说话人归属区别于ASR 嵌入聚类的组合式方案。实现见 funasr/models/sond。十一、第三方统一转写与说话人分离MOSS-Transcribe-Diarize模型发布方参数量备注MOSS-Transcribe-DiarizeOpenMOSS以官方模型卡为准第三方 Apache-2.0 模型单次离线请求返回转写、时间戳与说话人标签FunASR 集成无需外接 VAD 服务这是目录中唯一由第三方OpenMOSS发布、非 FunASR 团队训练的模型其许可为 Apache-2.0保留原作者归属。它的独特价值在于一体化一次离线请求同时产出文本、时间戳和录音内的匿名说话人标签无需像传统方案那样手动串联 VAD ASR 说话人聚类。但必须清醒认识其边界它不是实时流式模型也不是已知人物身份识别模型标签仅限单条录音内部。部署时请严格遵循专门的 docs/moss_transcribe_diarize.md适配器、原生上游服务、显存需求与响应边界不要照搬其他模型的流水线。十二、时间戳预测TP-Aligner模型语言训练数据参数量备注TP-Alignerdamo/speech_timestamp_prediction-v1-16k-offline中文阿里巴巴语音数据 50000h37.8M时间戳预测中等规模TP-Aligner 用于为文本-音频对预测时间对齐。它需要对应的文本输入是对齐任务而非 ASR且时间戳支持并非对所有识别器通用使用时必须匹配文档规定的输入/模型路径。对应别名fa-zh见 funasr/download/name_maps_from_hub.py实现见 funasr/models/monotonic_aligner 与 examples/industrial_data_pretraining/monotonic_aligner。十三、逆文本正则化ITNASR 文本后处理ITN 将语音识别输出的口语化文本二〇二六年还原为书面数字形式2026年是 ASR 后处理的关键环节。目录覆盖 12 种语言模型语言参数量备注Englishdamo/speech_inverse_text_processing_fun-text-processing-itn-enEN1.54MITNRussiandamo/speech_inverse_text_processing_fun-text-processing-itn-ruRU17.79MITNJapanesedamo/speech_inverse_text_processing_fun-text-processing-itn-jaJA6.8MITNKoreandamo/speech_inverse_text_processing_fun-text-processing-itn-koKO1.28MITNIndonesiandamo/speech_inverse_text_processing_fun-text-processing-itn-idID2.06MITNVietnamesedamo/speech_inverse_text_processing_fun-text-processing-itn-viVI0.92MITNTagalogdamo/speech_inverse_text_processing_fun-text-processing-itn-tlTL0.65MITNSpanishdamo/speech_inverse_text_processing_fun-text-processing-itn-esES1.32MITNPortuguesedamo/speech_inverse_text_processing_fun-text-processing-itn-ptPT1.28MITNFrenchdamo/speech_inverse_text_processing_fun-text-processing-itn-frFR4.39MITNGermandamo/speech_inverse_text_processing_fun-text-processing-itn-deGE3.95MITN这些权重与 fun_text_processing 目录下的规则引擎配套使用完整流程正则化 → 逆正则化 → 评估见 fun_text_processing/inverse_text_normalization/inverse_normalize.py 与 fun_text_processing/text_normalization/normalize.py。十四、源码级原理ModelScope 权重是如何被加载的要真正用好上述目录需要理解AutoModel与 ModelScope 的对接机制这涉及两条关键代码路径。14.1 别名映射短名 → 完整模型 IDfunasr/download/name_maps_from_hub.py 定义了name_maps_ms把易记别名映射到 ModelScope 完整 ID。与本文目录直接相关的映射包括name_maps_ms { paraformer: iic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-pytorch, paraformer-zh: iic/speech_seaco_paraformer_large_asr_nat-zh-cn-16k-common-vocab8404-pytorch, paraformer-en: iic/speech_paraformer-large-vad-punc_asr_nat-en-16k-common-vocab10020, paraformer-zh-streaming: iic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-online, fsmn-vad: iic/speech_fsmn_vad_zh-cn-16k-common-pytorch, ct-punc: iic/punc_ct-transformer_cn-en-common-vocab471067-large, ct-punc-c: iic/punc_ct-transformer_zh-cn-common-vocab272727-pytorch, fa-zh: iic/speech_timestamp_prediction-v1-16k-offline, cam: iic/speech_campplus_sv_zh-cn_16k-common, # ... }两个值得注意的事实别名不是不可变版本号例如paraformer-zh在当前 checkout 中解析到的是 SeACo Paraformerspeech_seaco_paraformer_large_...而非目录表格中的标准 Paraformer-large——这正是 model_zoo/readme.md 反复强调别名只是便利不是模型 revision 固定锚点的原因同样名称在不同 hubname_maps_hf下解析到不同仓库如funasr/paraformer-zh跨 hub 迁移时必须重新核对。14.2 下载与配置合并funasr/download/download_model_from_hub.py 的download_model(**kwargs)按hub分流ms/modelscope走download_from_mshf/huggingface走download_from_hfopenai走 Whisper 包装分支。ModelScope 分支的关键逻辑先查name_maps_ms做别名解析model_revision默认master通过modelscope.hub.snapshot_download拉取快照get_or_download_model_dir并携带user_agent标记调用方为 funasr读取模型目录内的configuration.json存在时按file_path_metas把init_param、config、tokenizer_conf.bpemodel、frontend_conf.cmvn_file等相对路径补全为绝对路径或config.yaml存在时合并配置并自动定位model.pt、tokens.txt/tokens.json、am.mvn、jieba_usr_dict等资产仅当trust_remote_codeTrue时才安装模型自带requirements.txt并动态导入remote_code指定的模型实现——默认关闭。这也解释了 ModelScope 模型目录的典型结构以 SenseVoice 为例的配置骨架见 docs/tutorial/Tables.mdconfig.yaml模型结构model.pt权重am.mvn前端 CMVN tokenizer 资源加上可选的configuration.json做路径解析。14.3 AutoModel 构造参数速览从 docs/python_api.md 与 funasr/auto/auto_model.py 可归纳与本目录相关的核心参数参数默认值说明model必填hub 别名、完整模型 ID 或本地模型目录hubmsms/modelscope或hf/huggingfacemodel_revisionmasterModelScope 转发该 revisiondevicecuda如cuda:0或cpu不可用的加速后端回退 CPUncpu4CPU 线程数进程级 PyTorch 线程vad_model/punc_model/spk_modelNone可选组件随vad_kwargs/punc_kwargs/spk_kwargs配置disable_updateFalse仅跳过 SDK 版本自检不跳过模型下载trust_remote_codeFalse是否信任模型自带代码/依赖开启前须审查十五、实战用 AutoModel 加载 ModelScope 权重15.1 单模型快速转写from funasr import AutoModel model AutoModel( modelparaformer-zh, # 别名解析到 SeACo Paraformerhubms 默认 hubms, devicecpu, # 或 cuda:0 ncpu4, disable_updateTrue, ) results model.generate(inputmeeting.wav) print(results[0][text])也可直接用目录中的完整 ID如modeliic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-pytorch绕过别名解析获取更确定的行为。首次运行需联网下载权重下载耗时、预热与推理应分开计时见 model_zoo/readme.md 的测量建议。15.2 组合完整流水线VAD ASR 标点 说话人目录中长音频版模型本质上是预打包的流水线若需自行组合用AutoModel挂载各组件即可组件别名均来自上文映射表pipeline AutoModel( modelparaformer-zh, vad_modelfsmn-vad, punc_modelct-punc, spk_modelcam, # 说话人嵌入聚类为录音内匿名标签 vad_kwargs{max_single_segment_time: 30000}, # 毫秒 devicecpu, disable_updateTrue, ) results pipeline.generate( inputmeeting.wav, batch_size_s60, # VAD 分段批处理时长预算秒 sentence_timestampTrue, ) for item in results: print(item.get(text, )) for sentence in item.get(sentence_info, []): print(sentence.get(start), sentence.get(end), sentence.get(spk), sentence.get(text, ))要点依据 docs/tutorial/README.mdmax_single_segment_time单位是毫秒两个批控参数单位是秒spk标签须从sentence_info内读取不要从外层结果直接取说话人簇标签是录音内的匿名标识不是跨录音的稳定身份流式场景应使用 Paraformer 流式版并维护独立的cache{}会话、在末帧传is_finalTrue详见 examples/industrial_data_pretraining/paraformer_streaming/demo.py。15.3 热词与文本后处理# 模型级上下文偏置SeACo/上下文 Paraformer 支持 biased model.generate(inputmeeting.wav, hotword魔搭 达摩院) # 输出文本的显式改写非模型热词 corrected model.generate( inputmeeting.wav, postprocess_hotwords{科大迅飞: 科大讯飞}, return_postprocess_hotword_matchesTrue, )注意hotword单数、空格分隔字符串与hotwords复数、Fun-ASR-Nano 等使用及language提示不是可互换的通用 SDK 选项必须匹配所选 checkpoint 的契约后处理实现见 funasr/utils/postprocess_hotwords.py。十六、从 ModelScope 走向生产训练、注册与部署目录中的预训练权重只是起点后续路径可按需选择微调/训练使用 docs/training.md 与 examples/industrial_data_pretraining/paraformer/finetune.sh 等配方训练数据格式参考 data/list/train.jsonl注册自定义模型基于注册机制tables.register将新模型接入AutoModel完整教程见 docs/tutorial/Tables.md 与 docs/model_registration.md导出与部署ONNX 导出参考 examples/industrial_data_pretraining/paraformer/export.py 与 runtime/python/onnxruntime/README.mdGGUF 路线见 runtime/llama.cpp/README.md注意 ONNX 导出 ≠ GGUF 转换服务化对照 docs/deployment_matrix.md 选择 OpenAI 兼容 APIexamples/openai_api、运行时 WebSocketruntime/readme.md或 MCP 服务examples/mcp_server质量与性能验证采用 docs/benchmark/rtf_reproducibility.md 的规范用代表性音频集分别测量 WER/CER 与 RTF/时延记录模型名、revision、FunASR 版本、设备与运行时路径切勿用单一干净样例下结论。十七、结语把目录当作契约而非承诺ModelScope 模型目录的价值在于快速定位与一键加载Paraformer 覆盖中英离线/实时全谱系UniASR 提供 18 语言 2-pass 一体化方案FSMN-VAD、CT-Transformer、Xvector/SOND、TP-Aligner 与 ITN 构成完整的 ASR 前后处理链路MOSS-Transcribe-Diarize 则代表第三方一体化转写-分离的新范式。但目录同时是契约而非承诺每个 checkpoint 的许可、revision、时长/通道边界、离线/实时契约与别名解析结果都必须在使用前逐一核实。将 model_zoo/modelscope_models.md、model_zoo/readme.md 与 funasr/download/name_maps_from_hub.py、funasr/download/download_model_from_hub.py 对照阅读即可在最短时间内建立从选模型到跑通推理再到生产部署的完整心智模型。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表