ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Buzz 离线语音转录详解:100 种语言、5 类后端,本地 Whisper 字幕方案完整指引

Buzz 离线语音转录详解:100 种语言、5 类后端,本地 Whisper 字幕方案完整指引 Buzz 离线语音转录详解100 种语言、5 类后端本地 Whisper 字幕方案完整指引【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz把会议录音转成文字稿或字幕上传到云端接口存在隐私风险而纯命令行跑 Whisper 又对新手不友好。Buzz 是一款桌面端语音转录与翻译工具基于 OpenAI 的 Whisper 模型在个人电脑上完全离线运行支持 100 种语言、5 类本地模型后端、TXT/SRT/VTT 三种导出格式全程无需联网上传。100 种语言与 5 类后端先看 Buzz 的能力清单先看几组能直接对照使用的数字。Buzz 的命令行接受 100 个语言代码从 Afrikaans 到中文Whisper 模型提供 tiny、base、small、medium、large 五档尺寸供按算力选择本地推理可选 5 类后端——Whisper、Whisper.cpp、Faster Whisper、Hugging Face 模型外加可选的 OpenAI Whisper API导出格式固定为 TXT、SRT、VTT 三种。测试条件方面本地模式在用户自己的 Windows、macOS 或 Linux 机器上运行速度取决于本地 CPU/GPU仅当你显式选择 OpenAI API 时才需要网络。作为基线对比相对云端转录服务Buzz 的代价是需要本地算力与模型下载收益是音频文件不离开本机相对直接用 Whisper 的 Python 库Buzz 多出了图形界面、任务队列、翻译与插件系统这一层封装。原理拆解一个音频文件如何走完转录流水线Buzz 的核心是一个把换引擎不换车身做足的转录层。用生活化类比Whisper 模型是发动机而 buzz/transcriber/ 目录下的抽象层是发动机接口——同一台车可以装 Whisper.cpp纯 C 实现走 CPU 或 Vulkan 加速、Faster WhisperCTC 解码优化版等不同发动机上层任务队列和界面不变。流水线上还有三个可选环节。转录前可开启语音分离基于 Demucs见 demucs_repo/ 目录或 DeepFilterNet 降噪插件把混在人声里的背景音乐剥离出去这是嘈杂录音准确率的主要增益来源转录中可选 Word-Level Timings为每个词打时间戳转录后支持说话人识别与字幕重分组。所有结果存入本地 SQLite 数据库表结构在 buzz/schema.sql因此断点续查、历史检索都靠这份本地数据。工程细节速度与显存的取舍点指标背后的工程手段集中在三个可调参数上。第一是量化Whisper.cpp 支持加载 q_5 等量化版本模型偏好设置里的 Reduce GPU RAM对应环境变量 BUZZ_REDUCE_GPU_MEMORY会把 Hugging Face、Faster Whisper 与 Whisper.cpp 的模型压到 8bit用少量精度换显存占用。第二是线程官方文档给出的实测数据是16 线程笔记本上将 BUZZ_WHISPERCPP_N_THREADS 从默认8 线程显式设为 8 可获得约 15% 的转录提速继续加线程反而变慢——这正是先给结论、再给条件的调参参考。第三是模型管理模型可在偏好界面内下载/删除用 BUZZ_MODEL_ROOT 指定存放目录国内环境可设 HF_ENDPOINT 走镜像加速下载。批量场景则由监听文件夹Watch Folder承接新文件落入目录即自动排队转录配合 Skip Already Transcribed 插件可跳过已有结果的重复任务。生态与配套插件系统、模型家族与开放接口Buzz 1.4.5 起提供插件机制在转录前处理音频、转录后改写结果、保存后触发动作三个钩子上扩展无需改核心代码。内置 6 个AI 摘要调用 OpenAI 兼容接口生成摘要并写入 Notes、增强语言检测先用本地 tiny 模型判定语种、导出 DOCX、字幕自动重分组、DeepFilterNet 降噪、跳过已转录文件也可通过 URL 导入社区 zip 插件。模型家族方面除原生 Whisper 系列外还支持 Hugging Face 上的 Whisper 兼容模型、Parakeet、Qwen3-ASR、VibeVoice ASR。翻译与摘要接口均可指向任意 OpenAI 兼容端点通过 Base URL 配置因此可以接入本地 Ollama 等自托管服务。界面已提供 15 种语言本地化含简中、繁中与日文。上手路径按目标分三条路线如果你只想跑起来Linux 用户执行flatpak install flathub io.github.chidiwilliams.Buzz一条命令即可其他系统可用 pip 方式需 Python 3.12pip install buzz-captions python -m buzz如果想改模型或加功能克隆仓库 https://gitcode.com/GitHub_Trending/buz/buzz 后从 buzz/transcriber/ 看后端接入、从 buzz/plugins/ 看插件写法测试目录 tests/ 里有对应单测可参考。如果你只想调用它命令行入口是buzz add例如buzz add --model-type whispercpp --model-size small --srt --vtt 音频文件详见 docs/docs/cli.md直播场景可开启实时转录导出用 BUZZ_UPLOAD_URL 或文本文件导出对接 OBS。资源清单中文 READMEreadme/README.zh_CN.md命令行文档docs/docs/cli.md插件源码buzz/plugins/模型批量下载脚本scripts/download-models.py如果你希望先把本地录音转成可检索的字幕再逐步换后端可以从上面的 pip 安装命令入手按硬件强弱依次尝试 tiny 到 large 的模型档位。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表