ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Buzz 完整本地离线音频转录指南:免费把录音变成文字和字幕

Buzz 完整本地离线音频转录指南:免费把录音变成文字和字幕 Buzz 完整本地离线音频转录指南免费把录音变成文字和字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 Whisper 的本地离线音频转录工具跑在你自己的电脑上把录音、视频、YouTube 链接里的语音免费转成文字和带时间轴的字幕全程不上传、不联网也能用。被录音堆成山的日子该结束了你大概遇到过这样的局面三个月的播客访谈原声堆在文件夹里加起来二十个小时。自己敲字一分钟音频至少敲三分钟算下来一周时间搭进去丢给在线转写服务一小时十几块先不说文件得传到别人服务器——而受访对象明明交代过内容不能上云。偏偏公司内网还不稳定排到一半任务断了前功尽弃。Buzz 就是冲着贵、泄密、断网就瘫这三件事来的转录在你本机完成一分钱不花断网照常跑。下面带你从安装到出字幕完整走一遍。它和在线转写服务的差别在哪先看一张表几个关键维度一目了然维度在线转写服务Buzz数据去向上传到第三方服务器始终留在本机费用按时长计费或订阅开源免费断网时直接不可用完整可用硬件利用取决于对方服务器本机 GPU/CPU 直接干活输出形态平台内查看为主TXT / SRT / VTT 文件自由导出支撑这些差别的是三个可以单独拎出来的底气隐私是默认状态不是付费选项。音频从导入到出结果每一步都在你自己的磁盘上发生。商业会议、用户访谈这类敏感素材不存在先传上去再回来的环节。开源意味着免费是长期的。代码完全开放社区迭代活跃你踩到的坑大概率在下个版本就被修掉而不是一封工单等一周。后端选项给得很足。NVIDIA 显卡走 CUDA 加速Mac 走 Apple Silicon 优化还有 Whisper.cpp 后端兼容 Vulkan、吃集成显卡甚至纯 CPU。没有独显只是快慢问题不是能不能用的问题。五步跑通你的第一个转录任务第一步安装。去下载对应系统的安装包Windows 双击安装程序未签名出现警告时选仍要运行macOS 装.dmgLinux 用 Flatpak 或 Snap 一条命令装好。第二步把音频丢进来。Buzz 认 MP3、WAV、FLAC、MP4、AVI 这些主流格式导入入口有四个挑顺手的工具栏上的按钮、快捷键CtrlOmacOS 为 CmdO、直接把文件拖进窗口或者粘贴一个YouTube 链接——它会自动拉取音频进流程做字幕不用再手动下载一遍。第三步配置任务。导入后面板里会展开任务类型、语言、模型、导出格式几个选项后面一节细讲第一次全用默认也能跑。第四步点运行。任务进队列开始处理进度条在任务列表里实时更新多个文件排队并发不用干等。第五步拿结果。状态变成Completed后双击那一行打开转录查看器逐句文本带时间戳可以搜索、可以跟着音频播放对照、可以直接导出成文件。四个参数决定转录结果好坏任务类型转录还是翻译。选转录输出和原声同语言选翻译Buzz 会把非英语内容直接转成英文文本。做中英对照稿、给外文访谈出英文底稿就靠切换到翻译。语言设置能手动就别自动。自动检测大部分时候靠谱但混着口音、夹杂外语的音频容易判错语言一错全错。事先知道录音是什么语言就手动指定准确率会稳很多。模型大小速度和精度的天平。从 Tiny 到 Large 分好几档档位在偏好设置的模型页里已下载的显示在列没下载的可以一键补。日常材料 Small/Medium 是甜点区间Tiny/Base 快适合实时场景和低精度要求Large 准重要内容和专业术语多的材料值得等它。输出格式TXT、SRT、VTT 可以多选。要纯文字稿勾 TXT给视频配字幕勾 SRT 或 VTT。勾选是独立的一次处理可以同时产出三份文件省得重复跑。拉开差距的几个进阶功能 字幕整形把一屏放不下的字幕救回来长录音转出的字幕常有两个毛病一行太长观众读不完或者一句被切成三行频繁跳。打开转录查看器里的Resize设一个目标最大长度它会按标点和语义重新断句把每行裁得整齐。开过词级时间戳的转录还能更进一步按停顿间隙合并碎字幕、按标点拆长句、按最大长度强制分块甚至统一延长每条字幕的停留时间。适配不同视频平台的字幕规范基本就是改这几个数字的事。实时转录边说话边出字Buzz 能直接吃麦克风输入人还在说屏幕上文字已经蹦出来了还能投到一个独立的演示窗口里放大展示。线上会议边开边出纪要、课堂实时记笔记、直播加字幕都是它的典型主场。说话人识别多人对话各归各位多人录音最烦的是通篇分不清谁在说话。在转录查看器里点Identify speakersBuzz 会自动给不同发言者的句子打上标签还能试听某位说话人的十秒片段确认身份然后把Speaker 0改成对方的真名。勾选合并选项后同一人的连续句子会并成一段访谈整理直接省掉一半工时。语音提取与降噪嘈杂环境的保险丝环境杂、背景音乐重的时候转录前先勾提取语音Extract speech把人声分离到独立音轨再识别准确率提升明显。另外还有个 DeepFilterNet 降噪插件转录前用模型把背景噪声滤掉吵录音也能救一救。让 Buzz 替你值班监控、插件和命令行文件夹监控在偏好设置里指定一个监控目录之后新音频文件一落进去Buzz 自动开跑全程无人值守。每周固定更新的播客、攒了一堆待处理的课程录音最适合交给它。插件系统Help → Plugins 里管理开关、排序、配参数都行。内置插件包括AI 摘要转录完自动提炼要点走 OpenAI 兼容接口、字幕自动整形转完直接按字幕规格重组、跳过已转录文件批量重跑时自动识别已完成项避免重复劳动、增强语言检测用本地 Whisper 先判语言再转录、导出 DOCX结果直接变 Word 文档、DeepFilterNet 降噪。要哪个开哪个。想看插件实现可以直接翻 buzz/plugins/。命令行给脚本党留的后门批量任务和定时脚本都好用。完整参数见 docs/docs/cli.md。# 转录单个文件指定中文同时导出 SRT 字幕、VTT 和 TXT 三种格式 buzz add --task transcribe --language zh --srt --vtt --txt interview.mp3 # 用 Whisper.cpp 后端把法语访谈翻译成英文 buzz add --task translate --model-type whispercpp --language fr interview-fr.mp3四类人四种用法照抄就行学生课程录音导入 → 转录 时间戳 → 文字笔记复习时点哪句跳哪句多语言课程也能直接出字幕。视频创作者成片视频导入 → 转录 Resize 统一行宽 → 导出 SRT 进剪辑软件字幕环节从半小时手工活变几分钟自动活。职场人会议实时转录 说话人识别 → 结构清晰的纪要当场生成敏感内容全程不出本机。研究者一文件夹访谈录音 文件夹监控 → 批量转写出说话人标签 → 文本直接进内容分析流程。把准确率再提五点的实战技巧先定模型再调别的。重要材料上 Large 档日常材料 Small 起步同一份音频先跑一遍小模型摸底确认值得再换大模型重跑别一上来就全用大模型干等。让硬件配得上模型。有 NVIDIA 显卡就确认 CUDA 后端生效速度能快数倍Mac 直接走 Apple Silicon 优化路径纯 CPU 环境模型降一档体验更顺。输入先做减法。录音时尽量安静、音量适中事后补救就勾提取语音或开降噪插件噪声少一分错字少一片。把专有名词塞进初始提示词。高级设置里的 Initial prompt 框填入人名、地名、专业术语这些词的识别率肉眼可见地涨技术讲座和医学访谈尤其受益。批量任务组合拳。文件夹监控负责进料跳过已转录插件负责去重小模型先过一遍、大模型挑重点重跑——三招叠上去批量处理的等待时间能砍掉大半。常见疑问速答Buzz 必须联网吗不用。所有处理都在本机只有你主动选 OpenAI API 后端时才需要网络。支持多少种语言99 种以上中、英、日、法、德等主流语言全覆盖识别和翻译都支持。处理速度如何取决于音频长度、模型大小和硬件。有 GPU 的机器通常能做到接近实时甚至更快慢就换 Whisper.cpp 后端或降一档模型。音频有长度限制吗没有硬性限制几秒钟的语音到几小时的长录音都能处理。离线电脑怎么装在联网电脑上把模型下好整份拷到离线机器的相同缓存目录偏好设置里可一键打开该目录之后断网照常转录。收尾Buzz 做的其实不只是转文字这件事它把转录从一项要花钱、要上传、看网络脸色的外包活变成了你电脑里一项随时可用、完全可控的能力。录音不再只是躺在硬盘里、再也不会被第二遍翻出的文件而是可搜索、可剪辑、可进工作流的文字资产。现在就把 Buzz 装上丢进你第一段落灰的录音——进度条走完的那一刻你会明白这一下午值了。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表