ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Insanely Fast Whisper 模型选择:large-v3 与 distil-large-v2,98 秒转完 150 分钟

Insanely Fast Whisper 模型选择:large-v3 与 distil-large-v2,98 秒转完 150 分钟 Insanely Fast Whisper 模型选择large-v3 与 distil-large-v298 秒转完 150 分钟【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper音频转文字时模型选大了精度上去了可显存先崩了。用 Insanely Fast Whisper 跑长音频到底该上 large-v3 还是切到 distil-large-v2选错了150 分钟的录音要么挂着等半小时要么直接 OOM。项目速览把 Whisper 跑出极限速度的终端 CLIinsanely-fast-whisper 是一个面向终端的语音转写 CLI底层用 Transformers Optimum flash-attn 把 Whisper 提速到极限。官方在 A100 80GB 上测得 150 分钟音频最快 98 秒转完大文件转写不用干等。核心代码在 src/insanely_fast_whisper/CLI 入口是 cli.py想自己调参直接看 README.md 的基准表insanely_fast_whisper_colab.ipynb 有完整示例。核心机制拆解换模型 开 FA2速度差能到 10 倍结论先行同一个 CLI选对模型、开 Flash Attention 2速度差能到 10 倍。下面从三个维度拆开看。转录速度98 秒 vs 19 分钟基准全在 README.md 的 A100 80GB 测试里150 分钟音频配置耗时large-v3 fp32~31 minlarge-v3 fp16 batching[24] FA2~1 min 38 secdistil-large-v2 fp16 batching[24] FA2~1 min 18 seclarge-v3 开 FA2 后从 31 分钟压到 98 秒提速近 19 倍distil 版再快 20 秒。资源占用3.09G 权重是硬门槛large-v3 权重文件是 3.09G见 insanely_fast_whisper_colab.ipynb 下载日志model.safetensors: 100% 3.09G/3.09Gfp16 加载还要叠加 batch 缓冲。默认--batch-size 24是为大显存调的显存紧就得手动调小。distil-large-v2 参数更少、权重更小同等配置下占用更低。输出质量精度换速度large-v3 是 OpenAI 旗舰版多语言、低音质、专业术语场景更稳。distil-large-v2 是蒸馏版牺牲少量精度换速度英文场景差距很小。--language不填走自动检测--timestamp支持chunk/word两档。选型决策表按显存和精度需求对号入座维度large-v3distil-large-v2权重体积3.09G更小速度FA2 / 150min~1min38s~1min18s精度旗舰多语言强蒸馏版英文够用显存门槛高较低典型场景法律/学术/多语言实时字幕/批量吞吐✅ 如果你要处理多语言、专业术语或低音质音频就选 large-v3如果你追求实时性、跑批量或显存有限就选 distil-large-v2。三步跑通两条命令上手先装 CLI。pipx会把它隔离进独立虚拟环境装完直接得到insanely-fast-whisper命令。pipx install insanely-fast-whisper跑 large-v3默认模型加--flash True开 FA2。预期看到进度条结果落到output.json。insanely-fast-whisper --file-name ted_60.wav --flash True换 distil 模型显存吃紧时把--batch-size调小防 OOM。insanely-fast-whisper --model-name distil-whisper/large-v2 --file-name ted_60.wav --batch-size 8 # 显存不足就调小容易踩的坑⚠️OOM 显存不足默认--batch-size 24是给大显存调的小卡直接报 OOM。调小--batch-sizeMac 上建议 4约 12GB 显存或换 distil 模型。Windows 报 Torch not compiled with CUDA根因未明在虚拟环境里手动装带 CUDA 的 torch指向官方 CUDA 12.1 wheel 源即可。python 3.11 装成旧版本pipx可能把版本解析错成 0.0.8。加--force --pip-args--ignore-requires-python强制装最新版。收尾回到开头显存够就上 large-v3 --flash True150 分钟音频 98 秒出结果显存紧就切 distil-large-v2 保吞吐。想接着出字幕可以看 convert_output.py 把output.json转成 SRT / VTT。【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表