ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Insanely Fast Whisper 模型选型指南:30 秒看懂 large-v3 与 distil-large-v2 怎么选

Insanely Fast Whisper 模型选型指南:30 秒看懂 large-v3 与 distil-large-v2 怎么选 Insanely Fast Whisper 模型选型指南30 秒看懂 large-v3 与 distil-large-v2 怎么选【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper把一段两个半小时的录音丢进本地转写流水线之前你可能要先回答一个问题Whisper 模型选 openai/whisper-large-v3 还是蒸馏版 distil-large-v2这篇文章基于 Insanely Fast Whisper 仓库的基准数据与 CLI 源码从速度、体积、适用环境三个维度对比两者帮你直接下结论。一屏速查large-v3 与 distil-large-v2 核心差异维度large-v3distil-large-v2模型定位OpenAI 旗舰大模型CLI 的默认模型--model-name默认openai/whisper-large-v3蒸馏版本需显式指定--model-name distil-whisper/large-v2下载体积model.safetensors约 3.09GColab 示例中的下载日志小于 large-v3无固定标注数值转录速度A100-80GB150 分钟音频fp16 batching[24] Flash Attention 2约 1 分 38 秒约 1 分 18 秒不加速时的参考值fp32 下约 31 分钟fp16 batching bettertransformer 约 5 分钟fp16 batching bettertransformer 约 3 分 16 秒支持任务transcribe / translatechunk 或 word 级时间戳可选说话人分离同左CLI 通用参数均可用仅模型名不同速度数字全部来自 README.md 中的 A100-80GB 基准表格同硬件、同配置下对比才有意义。为什么 distil 更快参数量与蒸馏的关系distil-whisper 是对 whisper-large 系列做蒸馏得到的版本通过压缩解码器结构减少了参数量每帧音频的推理计算量更小所以在相同的 fp16 批量 Flash Attention 2 配置下150 分钟音频能比 large-v3 快出约 20 秒。代价是容量更小遇到低音质、口音重或跨语言混杂的录音时参数更多、语言覆盖更全的 large-v3 通常表现更稳。简单说就是用一部分泛化能力换推理速度。跑一遍insanely-fast-whisper 模型安装与调用命令先装 CLImacOS 用--device-id mps指定 Apple Silicon 设备pipx install insanely-fast-whisper再分别用两个模型转录同一个文件--flash True开启 Flash Attention 2 提速insanely-fast-whisper --file-name ted_60.wav --flash True insanely-fast-whisper --file-name ted_60.wav --model-name distil-whisper/large-v2 --flash True两条命令都会把结果写进output.json包含speakers、chunks、text三个字段结构定义见 src/insanely_fast_whisper/utils/result.py即分块 时间戳 全文。如果 Mac 上 OOM把--batch-size降到 4 一般就能跑约占用 12GB 显存README 的 FAQ 有说明。选型建议按你的场景对号入座如果你的场景是归档长讲座、访谈这类对准确率敏感的音频就选 large-v3它正是 CLI 的默认模型不加参数直接用即可。如果是批量转录会议录音、追求更高吞吐和更短等待就选 distil-large-v2在 A100 上它能比 large-v3 快约 20 秒 / 150 分钟音频。如果你的机器显存紧张、经常要靠调低--batch-size才不 OOM就选 distil 版本它对显存的占用更友好。如果需要先零成本评估效果再定就用pipx run insanely-fast-whisper --file-name 你的文件 --help查看全部参数默认配置先跑一次 large-v3不满意再换模型名。所有可调参数设备号、时间戳粒度、说话人数量等都可以在--help输出里查到源码入口是 src/insanely_fast_whisper/cli.py想在没有 GPU 的环境复现对比可以看 notebooks/ 目录下的 T4 基准 Notebook。建议先收藏 README.md 里的完整基准表作为你调参时的参照系。觉得有用的话不妨点个关注后续会更新这个项目说话人分离diarization参数的实操教程。【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表