ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Buzz 本地语音转文字:两小时录音十分钟出 SRT 字幕

Buzz 本地语音转文字:两小时录音十分钟出 SRT 字幕 Buzz 本地语音转文字两小时录音十分钟出 SRT 字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz把一段两小时的面试录音丢进 Buzz几分钟后就得到一份带时间戳的 SRT 字幕文件想附带中文翻译也能顺手生成。Buzz 是基于 OpenAI Whisper 的语音转文字工具音频处理与模型推理全部在你自己的电脑上完成断网也能用文件不出机器。一句话讲清 Buzz 是什么Buzz 是在 Whisper 之上包了一层图形界面的离线语音转文字工具可以导入音频、视频文件做转录或翻译也可以直接对着麦克风实时录音转文字Windows、macOS、Linux 三个平台都能跑。后面还有播放校对、片段编辑、多格式导出这些下游能力核心转录逻辑集中在 buzz/transcriber/ 目录。下面按你实际会走的路径讲从装到出片。三分钟装好它Windows没有现成的包管理器命令直接去项目发布页下载安装文件运行 .exe 即可。注意应用没有做代码签名安装时会弹出警告窗口点更多信息 → 仍要运行就行。macOS下载 .dmg 打开把 Buzz 拖进 Applications 就完事了。macOS 版支持 Apple Silicon 硬件加速在 M 系列芯片的机器上推理速度比 Intel 版快一截。Linux官方提供 Flatpak 和 Snap 两种渠道任选其一flatpak install flathub io.github.chidiwilliams.Buzz或者sudo snap install buzzSnap 方式在部分发行版上需要先装 portaudio 等依赖。如果你习惯从源码装也可以走 PyPIpip install buzz-captions装完用python -m buzz启动前提是 Python 3.12 环境和 ffmpeg。实时录音转文字先录一条看效果文件转录之前建议先玩录音这条线因为它最直观几秒就能见效主界面切到录音转录标签页选好麦克风设备、目标语言和模型点红色圆钮开始录音说一句试试文字会实时出现在窗口里说完点停止按钮转录结果自动保存如果你是在讲座、会议这种场合用还可以开一个独立的演示窗口把实时字幕投到更大的屏幕上对应 buzz/widgets/ 里的 presentation 组件。实时转录对机器比较吃紧建议选 Whisper.cpp 后端模型用 base 或 small 起步流畅度会好很多。把一段音频变成字幕文件这是最常用的文件转录流程四步走完导入菜单文件 → 导入媒体文件CtrlO或直接点工具栏的mp3、wav、mp4 这些常见格式都认选参数弹窗里定任务类型转录还是翻译、语言和模型跑起来点运行任务列表里能盯实时进度看结果状态变成已完成后双击任务行打开转录查看器查看器里有个模式切换按钮三档对应三种看法时间戳模式表格列出每个片段的开始/结束时间和文本做字幕就靠它文本模式所有文本合并成一篇不带时间标记适合通读翻译模式显示翻译结果前提是先跑过翻译任务快捷键 CtrlT、CtrlE、CtrlL 可以跳过鼠标直接切模式。双击表格里的文本单元格就能改内容修改自动落库片段的起止时间也能微调——选中文本后用调整大小功能拖动边界或者用 Ctrl←/→改开始时间、CtrlShift←/→改结束时间每次步进 0.5 秒。不想开界面的话命令行也能干同样的事一行命令批量转并输出 SRTbuzz add meeting.mp3 --language zh --model-size small --srt位置参数可以传多个文件--vtt、--txt也能叠加加--hide-gui就纯后台跑。导出与二次编辑转录完成后的导出菜单在查看器工具栏里点导出就能看到各格式选项原文和译文都能单独导出TXT纯文本段落按音频间隔自动切分SRT / VTT字幕文件视频编辑软件直接拖进去就能用DOCXWord 文档由 plugins/export_docx/ 插件自动生成可选带不带时间戳校对环节有个播放三件套很实用勾选循环片段可以反复听某一段跟随音频打开后文本会自己滚到当前播放位置变速从 0.5x 拉到 2x用旁边的、−按钮微调听漏的地方放慢重听。键盘党可以再看一眼偏好设置 → 快捷键标签页所有快捷键播放/暂停是 CtrlP、跳转当前文本是 CtrlG、重播当前片段是 CtrlShiftP都能改成自己的习惯组合。让转录更快更准Whisper 本地部署的核心变量是模型大小 Buzz 里常见三档定位tiny / base最轻量实时录音和低配电脑首选small / medium速度和准确率的平衡点大多数人停在这里large 系列large-v3、large-v3-turbo准确率最高专业级转录再上模型在偏好设置 → 模型标签页里统一管理选哪个、下哪个、删哪个都在那。跑得慢的时候按这三条排查换更小的模型关掉抢资源的应用先提取语音再转录高级设置里开另外Buzz 对 Nvidia 显卡有 CUDA 加速Whisper.cpp 后端还能走 Vulkan核显机器也能吃到加速装好后在模型偏好里选对应后端即可。想录的是电脑里正在放的声音播客、线上会议而不是麦克风走虚拟音频设备Windows 装 VB-CABLE 后把它选为录音源macOS 用 BlackHoleLinux 则在 pavucontrol 里把应用声音重定向过来三平台思路一样。卡住了怎么办先翻 docs/docs/faq.md装不上、找不到模型、性能不达标这类高频问题基本都答了。没解决就去项目 Issues 提个 bug或者进 Discord 社区直接问也可以发邮件找作者。代码层面想动手的话PR 随时欢迎流程写在 CONTRIBUTING.md 里。去发布页把最新版 Buzz 拉下来今晚正在听的播客明早醒来就能收到一份带时间戳的字幕文件。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表