
Buzz 完整使用指南本地离线音频转录把录音免费变成文字和字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz硬盘里堆着十几小时访谈录音手动整理要一周在线转写工具要么按分钟收费要么要求你把音频传到别人的服务器。Buzz 是一款完全免费、全程在本机运行的本地音频转录工具基于 OpenAI 的 Whisper 模型一个开源语音识别模型把语音转成带时间戳的文字稿和 SRT 字幕。这篇指南带你从安装、调参到批量流水线一步步把它用熟。Buzz 适合谁三条选型标准选工具前先对号入座三条标准能帮你快速判断数据归属是硬需求吗如果音频里有会议内容、个人访谈、商业素材文件不离开本机这一条就足以选 Buzz如果只是偶尔转几条公开音频且不怕上传在线服务也可以。本地算力够吗转录吃算力模型大小直接决定速度与准确率。老旧纯 CPU 机器跑 tiny/base 没问题有独立显卡可以上 medium/large。有没有持续、重复的音频产出只转一次什么工具都行有固定频次的录音要处理Buzz 的文件夹监控和命令行才开始体现价值。选型关注点在线转写服务Buzz本地离线数据归属上传到第三方服务器文件全程留在本机费用按时长或订阅计费开源免费断网环境不可用完全可用需预下载模型算力要求无由本机硬件决定GPU 可加速Buzz 安装与首次转录三步出结果第一步安装。Windows 与 macOS 从官方发布渠道下载对应安装包双击按向导走完即可。Linux 可以直接用 Flatpak 或 SnapFlatpak 一条命令flatpak install flathub io.github.chidiwilliams.Buzz也支持pip install buzz-captions从 PyPI 安装需先装好 ffmpeg 并使用 Python 3.12 环境。第二步导入。点工具栏的按钮、按 Ctrl/CmdO或直接把文件拖进窗口。MP3、WAV、FLAC、MP4、AVI 等常见音视频格式都能导入还支持粘贴视频链接直接拉取音频。第三步运行。在任务行里选择任务类型转录/翻译、语言、模型和导出格式点运行。状态变为完成后双击该行即可打开转录结果直接复制或导出。转录参数调优模型、语言与提示词怎么选按影响面从大到小排四个杠杆决定转录质量模型类型与大小。这是最大的变量。tiny/base 快但糙适合实时场景small/medium 是日常甜点区间large 精度最高。大模型里 large-v3 多数语言最准但偶尔会无中生有turbo 则在速度和精度之间折中。实现后端上有 6GB 以上显存的 NVIDIA 显卡选 Faster Whisper速度提升明显、更省内存非 N 卡、Mac 或核显选 Whisper.cpp它支持 Vulkan 加速纯 CPU 也能跑实时级别的转录原生 Whisper 实现准确但吃内存一般不必首选。语言。官方建议手动指定语言比自动检测更稳。自动检测只看音频开头几秒多语言混杂时容易猜错。确实不知道语言时再开自动检测。初始提示词Initial prompt。在高级设置里填入音频里会出现的人名、地名、专业术语这些词的识别率会明显提升技术讲座和访谈场景尤其有效。输入音频处理。背景嘈杂时勾选提取语音Buzz 会先把人声分离出来再转录想要更强的降噪可以启用 DeepFilterNet 插件。做字幕时记得多勾一项勾选**词级时间戳Word-Level Timings**后后续的字幕整形功能才能按词合并分句输出格式 TXT、SRT、VTT 可以多选一次处理出多份产物。首选项Ctrl/Cmd,里还能配置导出文件名模板、OpenAI API 密钥等。能力扩展按场景解锁进阶功能字幕加工让 SRT 直接可用长录音转出的字幕往往行长短不一。在转录结果窗口点Resize字幕整形设定最大字幕长度Buzz 按标点符号断句、按静音间隔合并碎片还能给每条字幕统一延长显示时长。生成字幕时勾选过词级时间戳的话整形工具还会分析音频中的静音位置来校准切分点适配不同视频平台的字幕规范基本只是改数字的事。实时转录会议、课堂与直播选好转录任务、语言和麦克风点录音即可边说边出字。三种转录模式各有所长新句追加在下方、追加在上方或追加并修正会对上一句做纠错但对硬件要求更高。两个配套能力值得配上演示窗口把实时文字投到大窗口展示适合现场活动与演示实时导出把实时转录结果持续写入文本文件可接 OBS 等软件并可选配 OpenAI 兼容 API 做实时翻译。转录后加工说话人识别与查看器说话人识别打开转录结果点识别说话人Buzz 会给每段发言打上说话人标签可以试听某位说话人的句子、把标签改成真名还能把同一说话人的连续发言合并成整段。转录查看器双击转录行即可进入支持全文搜索Ctrl/CmdF、按段落循环播放、跟随音频自动滚动、0.5x–2.0x 变速还能用键盘方向键以 0.5 秒为步长微调每句的起止时间适合逐句校对。插件系统按需拼装工作流Buzz 自带一套轻量插件机制在帮助 → 插件里勾选启用、拖拽调整执行顺序。内置插件覆盖了几类高频需求AI 摘要转录完成后用 OpenAI 兼容 API 生成摘要存进备注或导出为文本文件导出 DOCX结果直接转成 Word 文档可选带上时间戳跳过已转录检测到文件已有结果时直接跳过批量重跑不浪费算力增强语言检测用本地 Whisper 模型在转录前判定语言适合语言未知的素材DeepFilterNet 降噪转录前先去除背景噪声。规模化与自动化从单点到流水线文件夹监控Watch Folder。在首选项的 Folder Watch 页面开启监控指定一个输入文件夹和一个输出文件夹之后任何新音频文件放进去都会自动转录还可以选择处理完后自动删除源文件。定期更新的播客、成批落盘的录音用这一招就能把重复劳动交给程序。命令行。完整的 CLI 适合脚本与定时任务最常用的就两条# 转录单个文件并一次性导出 SRT 与 VTT 两种字幕 buzz add --task transcribe --language zh --srt --vtt audio.mp3# 用 OpenAI API 批量翻译并隐藏主窗口适合挂后台 buzz add --task translate --model-type openaiapi a.mp3 b.mp3 --hide-gui完整参数模型类型、提示词、词级时间戳等见 CLI 文档。批量策略。先用 small 或更小的模型把所有文件快速过一遍摸底挑出重要的再用 large 重跑配合跳过已转录插件重复导入同一批文件不会重复消耗算力。场景速查四类角色的即用路径角色拿来即用的路径学生 / 老师课程录音导入 → 指定语言 medium 模型转录 → 导出 TXT → 查看器里 Ctrl/CmdF 搜关键词点中即跳转复习视频创作者导入视频 → 勾选词级时间戳 SRT 导出 → Resize 统一行宽 → 字幕直接进剪辑软件职场人会议选实时录音 → 说话人识别分人 → AI 摘要插件出结论 → DOCX 插件导出纪要研究者访谈录音批量导入 → 文件夹监控 跳过已转录插件 → 导出 TXT 做内容分析避坑与排障Windows 安装时弹安全警告。应用未做数字签名选更多信息 → 仍要运行即可这是正常现象。离线电脑用不了本地转录本身不需要联网但模型要先下载。在有网机器上下载好模型整个缓存目录拷到离线机器相同位置Linux~/.cache/BuzzmacOS~/Library/Caches/BuzzWindows%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache或用仓库里的 scripts/download-models.py 脚本提前准备模型缓存。麦克风报PaErrorCode-9999类错误。检查系统麦克风权限Windows 在设置 → 隐私 → 麦克风再确认杀毒软件没有拦截。转录异常或程序崩溃。多数是模型下载不完整到首选项 → 模型删掉重新下载仍不行就在帮助 → 关于里打开日志查看报错。另注意 Buzz 要求 CPU 支持 AVX2非常老的机器无法运行。GPU 反而更慢或报错。设置环境变量BUZZ_FORCE_CPUtrue强制走 CPUWindows 安装包需要 CUDA 12 才能启用加速旧版本会自动回落到 CPU。识别语言不对。别依赖自动检测凡能确认语言的一律手动指定大模型在低质量音频上有幻觉补出不存在的话的可能换回 large-v2 或更小模型对比一下。常见疑问FAQQBuzz 必须联网吗A本地转录完全不需要网络。只有两种情况用到联网首次下载模型以及你主动选择 OpenAI API 或 Hugging Face 模型时。Q支持多少种语言AWhisper 系列覆盖约 99 种语言中、英、日、法、德等主流语种齐全Hugging Face 后端还能加载 MMS 等模型族支持的语言更多。Q转得太慢怎么办A按顺序试换更小的模型 → 换 Whisper.cpp 后端 → 显存 6GB 以上则用 Faster Whisper → 实在不行把识别交给 OpenAI API。Q能转电脑里正在播放的声音吗A可以。需要虚拟音频设备把系统声音接进 BuzzWindows 用 VB CABLEmacOS 用 BlackHoleLinux 用 PulseAudio 的音频路由然后把虚拟设备选为麦克风即可。Q最新开发版本去哪拿ALinux 用户执行sudo snap install buzz --edge其他平台从官方仓库的 CI 构建区下载最近一次成功构建的产物。更多细节见 官方 FAQ。下一步现在就转你的第一段录音打开 Buzz把最长的那段录音拖进去选好语言点运行——等进度条走完你就拿到了第一份带时间戳的文字稿。顺手做两件事到首选项 → 模型里下载一个匹配你硬件的更大模型再到帮助 → 插件里把跳过已转录打开。第一次转录可能只要几分钟而它替你省下的是以后每一小时的整理时间。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考