ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Buzz 离线语音转录完整指南:从一个音频文件到 SRT 字幕

Buzz 离线语音转录完整指南:从一个音频文件到 SRT 字幕 Buzz 离线语音转录完整指南从一个音频文件到 SRT 字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款开源桌面应用把 OpenAI 的 Whisper 模型一套用于识别语音的深度学习模型直接跑在你自己的电脑上完成离线语音转录和翻译全程不需要把音频文件上传到任何服务器。它面向内容制作、录音归档等需要批量处理音频的使用者产出 TXT、SRT、VTT 三种格式的结果文件。下面按一条真实操作路径走一遍装好 Buzz、完成首次配置然后产出第一份字幕。什么情况下值得换一套本地 Whisper内容敏感不想出设备。合同录音、客户访谈、内部会议的音频如果直接丢给在线转录服务等于把内容交出去了。Buzz 的所有识别、翻译都在本地完成文件不离开硬盘。不想按分钟付费。云端转录普遍按时长计费量一上来成本很快失控。Buzz 买断硬件之后处理费用为零只消耗你自己的电。网络条件不允许。出差、内网、低带宽环境下云端服务要么连不上要么反复中断本地方案不受影响。唯一需要联网的环节是首次下载模型。能力地图一个音频文件从导入到导出导入文件、链接或麦克风把音频或视频文件拖进任务列表即可视频会先抽出音轨也支持粘贴视频平台链接直接导入。麦克风则用于实时转录任务边说边出文字。选模型五种后端、五档规格Buzz 内置多个转录后端OpenAI Whisper、Faster-Whisper、Whisper.cpp、Hugging Face 上的各类 Transformer 模型以及 OpenAI 云端 API这一项需要联网。本地后端提供 tiny、base、small、medium、large 五档规格规格越大识别越准、占用越高。多后端实现的入口集中在buzz/transcriber/目录想加引擎时从这里入手。转录排队执行与实时识别多个任务按顺序排进队列后台依次执行进度逐条更新。语言可以手动指定也可以留空让模型自动检测还可以设置初始提示词把高频专业术语写进去引导识别。两个可选预处理词级时间戳以及转录前先做语音分离把嘈杂背景里的人声提出来再识别。校对搜索、回放、改时间轴转录查看器内置搜索、播放控制和倍速调节可以直接编辑每段文字和时间点。开启说话人识别后不同发言者会被标注区分。字幕节奏不满意时用调整工具按间隔合并、按标点拆分或按最大长度切分逐句打磨。相关控件位于buzz/widgets/transcription_viewer/。导出一键 SRT、VTT、TXT查看器里的导出菜单同时列出三种格式翻译任务的结果可以连同译文一起导出。偏好设置里的默认导出文件名支持模板变量例如用原始文件名、任务类型、时间戳拼接批量处理时文件名自动规整。从零到第一份字幕按系统选安装方式macOS下载 .dmg 安装包Windows下载安装程序程序未签名安装时提示风险选仍要运行即可LinuxFlatpakflatpak install flathub io.github.chidiwilliams.Buzz或 Snapsudo snap install buzz从源码安装需要先装好 ffmpeg并使用 Python 3.12git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz pip install buzz-captions首次启动的三个确认点模型档位默认 tiny速度最快日常转写建议 base 或 small追求准确率再上 medium 及以上。所选模型首次使用时会自动下载这一步需要联网。输出路径在常规偏好里指定转录文件保存目录顺手把导出文件名模板改成自己习惯的格式。硬件加速NVIDIA 显卡走 CUDAPyPI 安装版需额外装 CUDA 版 torch说明见项目文档Apple Silicon 芯片原生优化集成显卡用户可以改用 Whisper.cpp 后端它支持 Vulkan 加速。启动应用python -m buzz两个进阶玩法播客制作工作流把本期节目音频拖入队列选 medium 档模型任务类型保持转录在初始提示词里写入节目名和常出现的人名、品牌名转完后打开说话人识别区分主持人和嘉宾进字幕调整用按间隔合并把碎句拼成适口的字幕段导出 SRT 上传节目同时导出一份 TXT 作为文稿存档访谈录音整理在偏好里配置监控文件夹把每天的访谈录音统一放进这个目录新文件落盘后自动排队转录不用手动添加嘈杂录音先勾选语音分离把环境音压下去再识别在查看器里逐段校对受访者的专有名词改完直接回放确认按受访者导出 TXT配合文件名模板变量自动归类调优与避坑清单按内存挑模型档位内存偏小或纯 CPU 环境tiny、base 最省心16GB 左右内存可以跑 medium有 NVIDIA 独显并启用 CUDA 时large 档才真正实用长音频几小时的录音建议用 Whisper.cpp 后端它的内存占用控制得比较克制也可以先切段再转实时字幕演讲或直播场景开启演示窗口转录结果会单独弹出一个窗口显示方便投屏识别不准先试初始提示词再考虑升一档模型或开启语音分离顺序比直接上大模型更省资源自动化图形界面之外还有命令行docs/cli.md里列了完整参数适合写脚本批量提交任务它不适合什么Buzz 的定位是本地桌面应用它不提供常驻服务端和高并发批处理能力也不适合移动端如果你的需求是程序内集成语音识别接口直接对接云厂商 API 更合适。另外虽然支持 OpenAI API 后端但那个后端需要联网不算离线方案。项目源码可通过安装章节的克隆地址获取适合想改代码或参与翻译的贡献者。如果你的核心需求是一套跑在自己机器上、从录音到字幕一站走完的离线转写流程Buzz 把这条链路所需的环节都覆盖到了。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表