ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

faster-whisper 完整使用教程:语音转文字提速 4 倍

faster-whisper 完整使用教程:语音转文字提速 4 倍 faster-whisper 完整使用教程:语音转文字提速 4 倍【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper用 Whisper 转语音时,你是不是也受够了一直等待?一条 13 分钟的录音,原版要跑两分多钟,模型一大内存还暴涨。faster-whisper 把 OpenAI 的 Whisper 语音识别移植到 CTranslate2 推理引擎上:准确率不变,速度最高提升 4 倍,内存占用更低。一行命令安装,不用装 FFmpeg,开箱即用。 faster-whisper 是什么:核心卖点与性能对比faster-whisper 是 OpenAI Whisper 语音识别的加速版,基于 CTranslate2 推理引擎重写,准确率与原版一致。三个主要卖点:同样准确率,速度最高快 4 倍8 位量化进一步省内存,CPU、GPU 都支持无需安装 FFmpeg,音频解码由内置的 PyAV 库完成官方基准,同一条 13 分钟音频的成绩:GPU(NVIDIA RTX 3070 Ti,large-v2 模型):原版 openai/whisper:2 分 23 秒,显存 4708MBfaster-whisper(float16):1 分 03 秒,显存 4525MBfaster-whisper(8 位量化):59 秒,显存 2926MBCPU(Intel i7-12700K,small 模型):原版 openai/whisper:6 分 58 秒,内存 2335MBfaster-whisper(8 位量化):1 分 42 秒,内存 1477MB faster-whisper 安装教程:一行命令搞定pip install faster-whisper就是这么简单!只需 Python 3.9 以上,音频解码由包内自带的 PyAV 库处理,你不用碰 FFmpeg。用 NVIDIA GPU 的话,再装 nvidia-cublas-cu12 和 nvidia-cudnn-cu12 两个库即可。 faster-whisper 使用教程:最小可用示例接下来看最小可用示例。核心转录逻辑在 faster_whisper/transcribe.py,音频加载在 faster_whisper/audio.py。from faster_whisper import WhisperModel # 加载 large-v3 模型,用 GPU 半精度运行 model WhisperModel(large-v3, devicecuda, compute_typefloat16) # 没有 GPU?换成 CPU 8 位量化 # model WhisperModel(large-v3, devicecpu, compute_typeint8) # 开始转录:beam_size 是速度与准确率的权衡旋钮 segments, info model.transcribe(audio.mp3, beam_size5) print(检测语言:, info.language, 置信度:, info.language_probability) for segment in segments: # 注意:segments 是生成器,开始循环才真正运行 print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})运行后,先看到检测出的语言和置信度,然后逐段打印起止时间与文本——就是一套现成的字幕数据。 faster-whisper 进阶特性详解这里要注意,下面四个特性都是提速的关键。词级时间戳:精确到每个词传 word_timestampsTrue,每个词都会带上开始和结束时间。想做逐字高亮的卡拉OK字幕?这就是你要的功能。一行代码搞定,不用自己算对齐。VAD 静音过滤:自动跳过无声段落VAD(语音活动检测)先找出音频里哪里有人说话,模型只转录这些部分。项目内置 Silero VAD:启用 vad_filterTrue 就能跳过静音段,默认只移除超过 2 秒的静音。长录音能省下不少计算时间。批量转录:13 分钟音频 17 秒跑完官方 BatchedInferencePipeline 把多段音频打包并行,把 GPU 利用率拉满。官方基准里,原本 1 分 03 秒的 13 分钟音频直接压到 17 秒。接口与 WhisperModel.transcribe 兼容,属于平替。8 位量化:显存占用直接减半把 compute_type 设为 int8 或 int8_float16,large-v2 的显存占用从 4525MB 降到 2926MB,耗时只多 1 秒。显存不够的卡,靠它就能跑大模型。 实战调优指南:新手必看 4 条建议按需求选模型:small 最快,large-v3 最准,还有蒸馏版 distil-large-v3 用少量精度换速度;别盲目选最大,显存可能不够。长录音开 vad_filter:跳过静音段直接提速;默认只移除超 2 秒的静音,在 vad_parameters 里可调得更激进。GPU 上换批量管线:BatchedInferencePipeline 加 batch_size8,13 分钟音频能压到 17 秒左右,接口与常规版一致。beam_size 按场景调:低于默认 5 更快,高于 5 更准;日常使用默认值就够。❓ faster-whisper 常见问题问:必须先装 FFmpeg 吗?不需要。faster-whisper 用 PyAV 解码音频,FFmpeg 的库已打包在 PyAV 里,装完即用。问:没有 GPU 能跑吗?能。device 设为 cpu,compute_type 设为 int8,small 模型内存只用约 1477MB,13 分钟音频 1 分 42 秒出结果。问:调了 transcribe 却没输出,怎么回事?segments 是生成器,不循环就不会真正开始转录。用 for 循环遍历它,或 list(segments) 强制跑完。 总结:现在就可以上手faster-whisper 保留了 Whisper 的准确率,速度最高快 4 倍,内存占用更低,还免去了 FFmpeg 的安装。不用等,装好它,下一条转录可能比你泡杯咖啡还快。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表