ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Buzz 本地语音识别完整指南:离线 Whisper 转录 5 分钟上手

Buzz 本地语音识别完整指南:离线 Whisper 转录 5 分钟上手 Buzz 本地语音识别完整指南离线 Whisper 转录 5 分钟上手【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款在本机离线完成音频转录与翻译的桌面工具由 OpenAI Whisper 驱动。音频文件全程不出你的电脑不依赖网络也没有 API 调用费用。它支持 99 种以上语言能处理本地音频、视频文件乃至 YouTube 链接转录结果可导出为 TXT、SRT、VTT并支持实时录音、说话人识别与插件扩展——对隐私敏感、网络不稳定或需要批量处理的人这是一套完整的本地语音识别方案。本地语音识别选型Buzz 与云端服务对比对比维度云端语音识别服务Buzz 本地方案隐私音频上传到第三方服务器文件始终留在本机网络依赖断网即不可用大文件上传慢完全离线可用使用成本按字符/时长计费有 API 额度一次安装零调用费用批量处理受文件大小与时长限制任务队列无硬性限制加速选项无NVIDIA CUDA / Apple Silicon / Vulkan简单说数据敏感或量大时选本地方案Buzz 在这条路线上是目前功能最全的开源选择之一。5分钟装好 Buzz 并跑通第一个转录普通用户走安装包三条路线✅ macOS从 SourceForge 下载.dmg双击安装✅ Windows从 SourceForge 下载安装包程序未签名弹窗选更多信息→仍要运行✅ LinuxFlatpak 或 Snap 一键安装flatpak install flathub io.github.chidiwilliams.Buzz开发者从源码安装需要 Python 3.12 和 ffmpeggit clone https://gitcode.com/GitHub_Trending/buz/buzzpip install buzz-captions python -m buzz首次运行后按Ctrl/Cmd O导入一个音频文件 → 选择任务如Transcribe、语言与模型 → 点 Run。状态变为 Completed 后双击该行即可打开转录结果。导入的完整选项可查 docs/docs/usage/1_file_import.md。核心功能拆解本地语音识别的 4 个高频场景批量转录用任务队列一次跑完多个音频功能主界面是任务队列表格每个任务独立显示状态Queued / In Progress / Completed / Failed、耗时与进度。解决什么问题一次导入十几个会议录音或讲座音频无需盯着单个文件等排完队让它自己跑失败的任务可以单独重跑不拖垮整批。怎么用连续用按钮添加多个文件逐个选好模型后统一点击运行处理完成的状态图标会变绿双击行内展开即可查看右侧⤢图标可直接打开查看器。模型选型速查按硬件和场景挑 Whisper 档位功能Buzz 支持多种 Whisper 后端原生 PyTorch、faster-whisper、whisper.cpp和多档模型后端代码见 buzz/transcriber/。解决什么问题不同档位的模型在速度、精度、内存占用之间取舍不同选错要么慢得离谱要么该识别的字没识别出来。怎么用在偏好设置的 Model 页签里固定默认模型避免每次转录都重选。模型档位适合场景速度精度硬件要求Tiny实时转录、老设备⚡⚡⚡⚡⚡⭐⭐低Base日常会议录音⚡⚡⚡⚡⭐⭐⭐中Medium重要访谈、多语言混读⚡⚡⚡⭐⭐⭐⭐高Large学术研究、最高精度⚡⚡⭐⭐⭐⭐⭐很高转录查看器边播放边校对一键导出 TXT/SRT/VTT功能双击任务打开查看器支持搜索、播放/暂停、调节播放速度每段文本对应时间轴。解决什么问题Whisper 结果偶尔有误逐段播放对照音频校对比纯看文本快得多字幕创作者可以直接在视图内编辑时间戳。怎么用播放头会随音频同步高亮当前段落选中任意段落可直接改文字导出时选 TXT 做文稿、SRT/VTT 做字幕一次导出完成。字幕时长裁剪把转录结果改成合规字幕功能Resizer 可以按字幕平台规则自动调整每行时间戳比如 YouTube 字幕单行最长 7 秒超了就拆分或合并。解决什么问题Whisper 输出的时间轴不保证符合各平台的字幕时长规范手动调几百条时间戳不现实。怎么用查看器中打开 Resize 选项卡选平台预设YouTube / 自定义秒数点 Apply 即批量生效改完再导出。进阶玩法文件夹监听自动处理新音频适合播客制作者、视频剪辑。偏好设置 → Folder Watch 添加目标文件夹并配置模型与导出格式之后丢进文件夹的新音频会被自动转录并输出。注意监听文件夹里的文件会直接进队列模型选大档会显著拖慢吞吐。实时录音 演示窗口适合会议记录、演讲直播。录音页签选麦克风与语言点开始录制即可滚动出文字打开 Presentation Window 获得全屏大字展示适合投给与会者。注意延迟设置建议先按语速试 20~30 秒实时场景建议用 Tiny/Base 档保证跟得上。插件系统适合想省人工的进阶用户。插件对话框里可启用 AI 摘要自动总结全文、自动字幕裁剪等插件源码见 buzz/plugins/使用文档见 docs/docs/usage/7_plugins.md。注意AI 摘要类插件需要额外配置 API其余本地插件开箱即用。人群场景速查按角色找推荐配置用户类型推荐功能关键配置访谈/讲座研究者批量队列 SRT 导出语言手动指定、Medium 档、Initial prompt 填专有名词YouTube 字幕作者查看器 ResizerSRT 格式、Base 档、字幕时长规则选 YouTube会议记录员实时录音 演示窗口Tiny/Base 档、延迟 20~30 秒、开演示窗口播客/剪辑团队文件夹监听监听目录 固定输出格式Base 档跑批快捷键完整定义见 buzz/settings/shortcuts.py常用组合Ctrl/Cmd O导入、空格播放/暂停均可在偏好设置里自定义。避坑速查3 个高频误区对照表误区事实建议模型越大效果越好大模型慢数倍且吃内存日常对话场景收益有限实时场景甚至会拖垮延迟日常 Base/Medium实时 Tiny只有精度瓶颈再上 Large语言选自动检测省心自动检测基于开头片段判断前几句判断错整段都会跑偏混合语言必错只要知道语言就手动指定音质差不影响结果背景噪音、远场拾音、多人抢话都会明显拉低准确率转录前开启语音分离选项先提取干净人声再识别写在最后Buzz 把转录、翻译、校对、导出整条链路收进一台离线设备是隐私敏感与批量场景下的稳妥选择。建议你先从一个真实的音频文件开始装好后导入、选对语言、跑一遍 TXT 导出10 分钟内就能判断它是否匹配你的工作流。跑通之后再按角色速查表逐项打开高级功能比一次性配置所有选项高效得多。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表