
Dolphin模型选型指南base、small、medium、large怎么选最适合你【免费下载链接】DolphinDolphin is a multilingual, multitask ASR model jointly trained by DataoceanAI and Tsinghua University.项目地址: https://gitcode.com/gh_mirrors/dolphin22/DolphinDolphin 是由 DataoceanAI 与清华大学联合训练的开源多语言多任务ASR语音识别模型支持 40 种东方语言与 22 种中文方言可同时完成语音识别、VAD 端点检测、语音分段和语种识别。面对Dolphin模型选型这个新手常遇到的问题本指南将用最简单的方式讲清 base、small、medium、large 四个尺寸的区别帮你快速找到最适合自己的那一款。为什么 Dolphin 值得关注Dolphin 采用 CTC-Attention 联合架构编码器基于 E-Branchformer解码器为标准 Transformer训练数据超过 21 万小时。它沿用了 Whisper 与 OWSM 的创新思路并做了针对性改进引入两级语言标记体系语言 区域让模型能更精细地处理不同地区的中文方言和东方语言。上图展示了 Dolphin 的多任务数据格式从 SOS 起始符出发依次包含语言LANGUAGE、区域REGION、转录TRANSCRIBE标记输出既支持带时间戳的文本也支持纯文本转录这也是它能同时做识别、分段、打时间戳的原因。Dolphin模型选型核心四个尺寸的完整对比官方规划了 4 个规格的模型参数规模从 0.1B 到 1.7B 不等模型参数量当前是否开放定位base0.1 B✅ 已开放轻量入门small0.4 B✅ 已开放均衡主力默认medium0.9 B⏳ 规划中高精度large1.7 B⏳ 规划中旗舰级注意目前公开可用的主要是 base 和 small 及其衍生版本medium、large 尚未开放选型时请优先考虑现有模型。base轻量部署的最佳起点base0.1B适合谁追求低延迟、低资源消耗的开发者。如果你只是想在 CPU 上快速验证效果或者部署到资源受限的边缘设备base 是最省心的选择。它体积小、加载快日常短语音转写完全够用。small官方默认的均衡主力small0.4B是官方 CLI 工具的默认模型也是绝大多数用户的首选。它在准确率与速度之间取得了最佳平衡无需指定--model参数即可直接使用。无论你是个人开发者还是中小型项目从 small 入手基本不会出错。medium 与 large等待开放的旗舰精度medium0.9B和 large1.7B代表了更高的识别精度上限适合对准确率有极致要求的场景如专业字幕、会议纪要但目前尚未开放下载可以先关注官方更新届时再迁移升级。中文方言场景别忘了 .cn 家族如果你的语音数据以中文为主选型时还应关注专门的中文方言系列dolphin/model_registry.py中定义了全部可用模型模型名特点适用场景base.cn中文方言增强中文为主、兼顾方言base.cn.streaming中文流式识别实时字幕、直播转写small.cn中文方言均衡版中文高精度场景small.cn.streaming中文流式均衡版实时会议、客服质检small.cn.prompt支持提示词热词热词纠错、专业术语Dolphin 共支持 22 种中文方言区域码如zh-SICHUAN四川话、zh-SHANGHAI上海话、zh-MINNAN闽南语等完整清单见 languages.md。按场景快速决策一张表搞定选型你的需求推荐模型理由首次体验、CPU 环境base加载快、够轻量通用中英混转写small官方默认均衡实时字幕/直播base.cn.streaming / small.cn.streaming流式低延迟中文方言重度场景small.cn中文专项增强人名、专业词纠错small.cn.prompt热词提示词加持五分钟快速上手安装与使用Dolphin 使用非常简单先安装 FFmpeg 并执行pip install -U dataoceanai-dolphin随后一行命令即可完成转写# 默认使用 small 模型 dolphin audio.wav # 指定中文方言模型 dolphin audio.wav --model small.cn --lang_sym zh --region_sym CN # 流式模型示例 dolphin audio.wav --model small.cn.streamingPython 调用同样直观核心入口是 dolphin/transcribe.py 中的load_model与transcribeimport dolphin from dolphin import transcribe model dolphin.load_model(small.cn, devicecuda) result transcribe(model, audio.wav, lang_symzh) print(result.text)模型首次使用时会被自动下载并缓存在~/.cache/dolphin/目录下载后本地运行不依赖网络。总结Dolphin 模型的选型并不复杂入门选 base通用选 small中文方言选 .cn 系列实时场景选 streaming热词纠错选 prompt。medium 和 large 虽未开放但 Dolphin 的模型注册表 dolphin/model_registry.py 已预留扩展位未来升级路径清晰。现在就用pip install -U dataoceanai-dolphin安装从 base 或 small 开始你的第一条语音转写吧【免费下载链接】DolphinDolphin is a multilingual, multitask ASR model jointly trained by DataoceanAI and Tsinghua University.项目地址: https://gitcode.com/gh_mirrors/dolphin22/Dolphin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考