
用 faster-whisper 离线转写 1 小时音频CPU 与 GPU 实操备忘【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper周五下午 4 点你手里有一段 47 分钟的访谈录音周一早会前要交文字稿。逐字听打一整个下午都未必完稿交给在线服务又要权衡录音内容的保密性。faster-whisper 是基于 CTranslate2 重写 OpenAI Whisper 的 Python 库在本地把音频转写为文本官方 README 给出的结论是相同准确率下比 openai/whisper 快至 4 倍且更省内存8 位量化还能进一步压缩开销。一张表看清能力边界与资源开销维度表现依据速度相同准确率下较 openai/whisper 快至 4 倍README 原文up to 4 times官方 READMEGPU 资源large-v2int8 占显存 2926MBfp16 占 4525MBREADME 基准RTX 3070 TiCPU 资源small 模型 int8 内存占用 1477MBREADME 基准i7-12700K精度distil-large-v3 的 WER 为 13.527对照 transformers 同环境 14.801README 基准YT Commons语言覆盖多语言支持默认按前 30 秒音频自动检测语言也可显式指定源码transcribe.py部署方式支持 / 部分支持 / 不支持离线转写支持批量推理支持说话人分离不支持GUI 不支持README 与社区清单适合需要离线批量处理录音、且手里有 GPU 或高性能 CPU 的团队不适合想零代码点鼠标出结果、或指望它直接做说话人分离的使用者。按使用强度选模型档位与计算类型先判断自己属于哪种强度再定档位而不是上来就装最大的模型轻量试用每月几条录音CPU 即可模型base或smallcompute_typeint8硬件门槛4 核以上 CPU、8GB 内存small int8 占用 1477MBREADME 基准预期耗时13 分钟音频在 i7-12700K 上 int8 用时 1m42s折算 1 小时录音约 8 分钟按 README 数字推算日常生产每日会议、字幕批量转写推荐 GPU模型large-v3或turbocompute_typefloat16显存紧张改int8_float16硬件门槛8GB 显存的 NVIDIA GPUlarge-v2 fp16 4525MB、int8 2926MBREADME 基准预期耗时batch_size8时 13 分钟音频 17 秒折算 1 小时约 80 秒按 README 数字推算高并发服务给团队开批量转写任务模型GPU BatchedInferencePipelineREADME 基准中 distil-large-v3 用了batch_size16硬件门槛batch_size8需 6090MB 显存README 基准更大批次建议 16GB 显存部署仓库docker/目录提供示例 Dockerfile 与infer.py可作为容器化起点15 行跑通基础转写pip install faster-whisperfrom faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(interview.mp3, beam_size5) print(语言:, info.language, 概率:, info.language_probability) for segment in segments: # 注意遍历前不会真正开始转写 print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})适用边界单文件、单机、一次性产出文字稿的场景够用需要说话人分离或流式字幕时要再套一层外部项目README 的社区集成清单里有现成方案。常用参数速查默认值来自 1.2.1 版本transcribe签名参数默认值什么时候调vad_filterTrue内置 Silero VAD 默认只过滤超过 2 秒的静音可用vad_parameters收紧word_timestampsFalse做字幕时必须开输出词级起止时间language自动检测中文等语种显式传languagezh更稳tasktranscribe设为translate输出目标语言译文hotwordsNone固定人名、产品名、术语的识别condition_on_previous_textTrue长音频出现滚雪球式误识别时置Falsebatch_size8仅批量推理管线生效越大越快、显存越高两个可直接照搬的工作流一CPU 上把 1 小时访谈压进 10 分钟工具链faster-whisper 内置 Silero VAD 笔记软件。录音导出为 mp3库加载时经 PyAV 解码无需系统安装 FFmpeg自动重采样为 16kHz 单声道见源码faster_whisper/audio.pytranscribe(path, vad_filterTrue)默认滤掉超过 2 秒的静音段遍历 segments 落盘为纯文本粘进笔记软件校对专有名词。可量化收益small 模型 int8 下 13 分钟音频用时 1m42sREADME 基准i7-12700K 八线程1 小时录音约 8 分钟出初稿。二GPU 上批量生成词级字幕工具链BatchedInferencePipelinect2-transformers-converter SRT 导出脚本。模型权重首次运行自动从 Hugging Face Hub 下载也可用转换器把自有微调模型转为 CTranslate2 格式batched_model.transcribe(path, batch_size8, word_timestampsTrue)从segment.words逐词导出 SRT导入剪辑软件对齐校对。可量化收益large-v2 在 RTX 3070 Ti 上 fp16、batch_size8时 13 分钟音频仅需 17 秒README 基准2 小时长片推理约 2.5 分钟。对照根因表排查高频故障现象根因处理动作初始化报 cuBLAS/cuDNN 缺失新版 ctranslate2 仅支持 CUDA 12 cuDNN 9装 CUDA 12 的 cuBLAS/cuDNNCUDA 11 环境按 README 降级 ctranslate2 到 3.24.0首次运行卡在模型下载权重默认从 Hugging Face Hub 拉取手动下载 Systran 模型放到本地WhisperModel直接传本地目录CPU 转写明显慢于预期未量化、线程数未受控换compute_typeint8用OMP_NUM_THREADS固定线程数再对比长音频同一句反复滚雪球式误识别condition_on_previous_text让错误累积置False或改用 distil-large-v3README 示例即如此拿到 segments 却打印不出任何内容transcribe返回生成器遍历前不执行list(segments)或放进 for 循环README 明确警告GPU 显存不足大模型用了 fp16改compute_typeint8_float16large-v2 显存从 4525MB 降到 2926MBREADME已知能力边界本项目暂不支持原生说话人分离也不提供真正的实时流式推理接口与任何图形界面——流式字幕和分离需要外挂社区项目README 社区清单列有 Whisper-Streaming、whisper-diarize 等它也不是训练框架微调得到的 checkpoint 需先用ct2-transformers-converter转成 CTranslate2 格式才能加载。三周从试用走到稳定生产第 1 周跑通确认 Python ≥ 3.9装库后用base int8 在自己 2~3 段真实录音上跑通transcribe人工抽查准确率同时确认机器走 CPU 还是 GPU 路线GPU 需核对 cuBLAS/cuDNN 版本。第 2 周调参跑通 benchmark/ 下的脚本在自己机器上测出实时比基准打开word_timestamps、hotwords解决专有名词与字幕对齐问题有 GPU 时切到large-v3/turbo fp16 复测耗时。第 3 周固化把转写封装为批处理脚本或 Docker 服务输出 SRT/Markdown 归档对识别不稳的领域微调模型后转换为 CTranslate2 格式接入。参数细节随时查 faster_whisper/transcribe.py 的transcribe签名那里有全部选项的默认值与说明。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考