ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Buzz 离线语音转文字教程:从安装到字幕导出的完整上手指南

Buzz 离线语音转文字教程:从安装到字幕导出的完整上手指南 Buzz 离线语音转文字教程从安装到字幕导出的完整上手指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款运行在你自己电脑上的离线语音转文字工具导入音频文件它调用本地的 OpenAI Whisper 模型把语音转成文字或直接翻译成英文。全程不上传任何音频覆盖 100 种语言纯 CPU 就能完成转录适合需要会议纪要、视频字幕或批量处理录音、又没有 GPU 条件的用户。装好它并转出第一条文字各平台的安装方式如下选一行照做即可系统安装方式命令或操作Windows从项目发布页下载安装包运行安装程序安装包未签名弹窗时点更多信息 → 仍要运行macOS从项目发布页下载.dmg拖入应用程序LinuxFlatpak 或 Snapflatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzzPython 用户pip 安装需 Python 3.12 并装好 ffmpegpip install buzz-captions然后python -m buzz源码安装克隆仓库按 README 装依赖git clone https://gitcode.com/GitHub_Trending/buz/buzz装好后直接做第一次转录。点菜单栏文件 → 导入媒体文件或工具栏的图标快捷键Ctrl/Cmd O选一个 MP3、WAV 或 MP4 文件。弹窗里设好三项参数Task选 Transcribe同语言转写或 Translate to English转成英文Language默认是自动检测知道录音语言就手动选上检测只看开头几秒手动指定更稳Model先用 Tiny 或 Base够快模型档位后面单独讲。点 Run任务进入队列等状态变成 Completed双击那一行就打开转录查看器带时间戳的文字稿已经生成。场景会议录音变成可编辑文稿假设你有一段两小时的会议录音转写完打开查看器。时间戳表格里每一行是一个带起止时间的句子双击文本单元格直接改字改动自动保存——Whisper 听错的人名、项目名就地修正不用回到终端里找参数。专有名词反复出错的话在导入时的 Advanced 选项里把常见专有名词写进Initial prompt转写时模型会参考提示词错字会明显减少。翻译在两条路径上完成导入时把 Task 设为 Translate to English任何语言直接出英文稿这是 Whisper 自带的离线能力需要其他目标语言比如英译西在查看器点 Translate填入一个 OpenAI 兼容的 API 地址和密钥并写一句翻译指令只翻译、不加注释之类本地跑一个兼容模型也能接上。稿子定稿后从查看器工具栏导出内置 TXT、SRT、VTT 三种格式需要 Word 文档时在插件页启用内置的export_docx插件见 plugins/导出菜单里就会出现 DOCX。导出的文件名和存放位置可以在偏好设置里用模板自定义例如按输入文件名 转录时间命名设一次以后每次自动套用。场景给视频做能直接用的字幕字幕和文字稿的关键差别是断句。做法分两步。第一步在导入时就决定勾上Word-Level Timings词级时间戳。它让 Buzz 为每个词单独生成时间这是后续字幕重组功能的前提没勾选的话只能拿到整句级的切分。第二步用查看器工具栏的Resize按钮。对词级时间戳的转录你可以按标点分割句子、设置单行最大长度默认 42 字符再把短句按静音间隙合并一键重组成规整的字幕行长句不再被拦腰切断。重组完点导出选 SRT 或 VTT文件可以直接导入剪辑软件或视频平台不用再做任何格式转换。场景实时出稿与夜间批量实时录音现场边说边出文字切到主界面的 Live Recording 标签页选好麦克风、任务、语言、模型点红色 Record 按钮文字随说话实时生成。录音进行中可以打开Presentation Window把实时字幕投到第二块屏幕适合演讲、直播同屏看稿。实时转录的性能设置只有一个原则后端选 Whisper.cpp模型选 Tiny 或 Base文字才能跟上语速。偏好设置里的录制模式有 Append below逐句追加和 Append and correct追加并回头修正刚生成的句子后者准确率更高但更吃硬件细节可参考 Live Recording 官方文档。想转写播客、会议软件这类电脑里放出来的声音装一个虚拟音频线macOS 用 BlackHoleWindows 用 VB-CABLE 等把系统输出改道再把 Buzz 的麦克风选成对应的虚拟设备即可。用命令行跑夜间批量文件多了之后GUI 逐个操作就不划算了。buzz add命令一次接收多个文件一条命令处理整批任务buzz add --model-type whispercpp --model-size small --language zh --srt --vtt --hide-gui 会议.mp3 访谈.wav这条命令用 Whisper.cpp 后端的 small 模型转写两个中文文件同时输出 SRT 和 VTT--hide-gui让它安静跑完不开主窗口。常用的还有--prompt写入常见专有名词、--task translate翻译成英文、--output-directory指定输出目录。把它交给系统定时任务夜里跑完一整文件夹早上直接收稿。速度与质量怎么调转录质量的分水岭在模型。Buzz 支持 Whisper、Whisper.cpp、Faster Whisper、Hugging Face可加载其他 Transformer 模型和 OpenAI API 五种后端模型档位从 Tiny 到 Large-v3 如下附.en纯英文版与自定义模型模型体积适合场景Tiny约 73 MB实时转录、快速看大意Base约 139 MB低配机器日常转写Small约 462 MB日常转录的平衡点多数人首选Medium约 1.5 GB口音重、术语多的专业录音Large / Large-v3约 2.9 GB最高精度建议有 GPULarge-v3-turbo约 1.6 GBLarge 级别的速度/精度折中两个配套设置决定实际效果。语言尽量手动指定自动检测只依据开头几秒中文录音手动选zh能明显减少串语种。加速方面NVIDIA 显卡在偏好设置里启用 CUDAApple Silicon 自动走加速路径GPU 有问题排查时可用环境变量BUZZ_FORCE_CPUtrue强制纯 CPU。模型在偏好设置 → Models页统一管理勾选下载即可也支持粘贴自定义模型的下载地址建议提前在好网络下把常用档位拉好。 同一个模型Whisper.cpp 后端在相同硬件上通常比默认后端更快实时场景优先用它。出问题先看这里现象原因处理转出的语言或文字不对自动检测只看开头几秒导入时手动指定语言中文选zh实时转录跟不上语速默认 Whisper 后端开销大换 Whisper.cpp 后端 Tiny/Base 模型字幕断句怪Resize 合并不生效转录时没开词级时间戳重新转录并勾选 Word-Level TimingsWindows 安装弹安全警告安装包未做代码签名点更多信息 → 仍要运行正常现象GPU 加速没生效驱动未装好或模型超出显存确认模型偏好里能看到 CUDA 选项用BUZZ_FORCE_CPUtrue回退纯 CPU模型下载慢或中断Large 级模型接近 3 GB换稳定网络重试或用偏好设置里的手动下载功能现在打开 Buzz导入一份你最需要整理的录音把 Task 设成 Transcribe、语言选对点 Run 跑出第一条转录。要出字幕的话记得转录前勾上 Word-Level Timings完成后直接导出 SRT 就能用。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表