ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Silero VAD 到底怎么用?3行代码跑通语音活动检测

Silero VAD 到底怎么用?3行代码跑通语音活动检测 Silero VAD 到底怎么用3行代码跑通语音活动检测【免费下载链接】silero-vadSilero VAD: pre-trained enterprise-grade Voice Activity Detector项目地址: https://gitcode.com/GitHub_Trending/si/silero-vadSilero VAD 是一个预训练语音活动检测Voice Activity DetectionVAD模型给它一段音频它告诉你哪些时间段有人说话。模型体积约 2MBCPU 单线程处理一个 32 毫秒的音频块不到 1 毫秒MIT 协议无注册、无密钥、无遥测。Silero VAD 解决什么实际问题 做语音助手的人都知道识别服务 24 小时对着麦克风安静时段也在空烧算力做播客、会议转录的又得先从 3 小时录音里剪掉沉默片段。Silero VAD 的定位就一句话——在整条语音链路最前面回答现在到底有没有人说话然后把答案起止时间戳交给后面的 ASR 或处理流程。部署前确认这几个硬指标 指标数值模型体积JIT 模型约 2 MB依赖Python 3.8、torch ≥ 1.12、torchaudio ≥ 0.12ONNX 路线另需 onnxruntime ≥ 1.16.1速度单核 CPU 处理 32ms 音频块 1ms批量或 GPU 可再加速采样率8000 Hz 和 16000 Hz许可证MIT平台PyTorch / ONNX 两大运行时覆盖的环境均可最快跑通3行代码拿到时间戳 先一条命令安装pip install silero-vad下面这段脚本加载模型、读音频、输出语音段如果想在仓库里直接验证clone 后可以用自带的 tests/data/test.wav 当输入仓库地址git clone https://gitcode.com/GitHub_Trending/si/silero-vadfrom silero_vad import load_silero_vad, read_audio, get_speech_timestamps model load_silero_vad() wav read_audio(your_audio_file.wav) stamps get_speech_timestamps(wav, model, return_secondsTrue) print(stamps)预期看到一叠字典形如[{start: 1.24, end: 3.87}, ...]每对数字就是一段语音的起止秒数——能打印出非空结果说明环境已跑通。工作原理32 毫秒切一块逐块打概率 它不听完整段音频再下结论而是把音频切成 512 个采样点16k 下约 32ms的小块每块输出一个 0~1 的概率这段像人话的程度。类比物业保安每 32 毫秒往走廊瞄一眼记下像有人说话还是只是噪音。后处理层再把连续的像说话记录拼成一段语音比 250ms 还短的闪断直接丢掉防止咳嗽、拍桌被当成话遇到足够长的静音就切段。模型内部还带状态记忆下一块不用从头听——像连续读同一篇文章这样麦克风流式输入时才能做到低延迟。进阶路线轻量、部署、调优三档按需跳读 轻量使用默认参数阈值 0.5在大多数音频上够用CPU 场景建议torch.set_num_threads(1)省掉多线程开销。麦克风实时流用VADIterator配合collect_chunks做分片输出完整写法见 examples/pyaudio-streaming/。生产部署不想引入 PyTorch 依赖时切 ONNX需先pip install onnxruntimemodel load_silero_vad(onnxTrue, opset_version16)某些 CPU 上 ONNX 比 JIT 快 4~5 倍。非 Python 技术栈有现成示例C、Rust、Go、Java、C#Intel 加速参考 examples/openvino/。各变体模型文件含半精度silero_vad_half.onnx都放在 src/silero_vad/data/。调优有自有音频集时用 tuning/search_thresholds.py 自动搜阈值用 tuning/tune.py 在自己的数据上微调配置项见 tuning/config.yml。min_speech_duration_ms、max_speech_duration_s、speech_pad_ms等切段参数的定义都在 src/silero_vad/utils_vad.py。适用与不适用场景对照 ✅适合实时语音链路会议、通话、唤醒前端、长音频批量切分与清洗、只有 CPU 的边缘设备、8k 电话语音。不适合它只回答有没有人说话——不做说话人区分谁在说也不做语音识别说了什么silero_vad_16k_op15.onnx只支持 16k 采样率KTV、街头采访这类强噪声场景默认阈值容易漏报或误报得先跑一遍阈值搜索或微调。避坑清单四个高频问题的解法 ⚠️现象read_audio报找不到音频后端 →原因torchaudio 读音频需要后端支持 →解法pip install soundfile或装 ffmpeg / sox三选一。现象结果全空或时间对不上 →原因音频是 8k但get_speech_timestamps默认按 16000 处理 →解法重采样到 16k或显式传sampling_rate8000。现象噪声环境误报多 →原因阈值 0.5 对噪声偏宽松 →解法把threshold提到 0.7~0.9或用 tuning/ 工具在自己的数据上搜阈值。现象ONNX 直接调用报 Provided number of samples is ... →原因每次输入必须是恰好 512 个采样点8k 为 256→解法按 512 切片或直接用VADIterator这类封装好的入口。仓库资源地图 官方交互演示silero-vad.ipynb多路并行批处理examples/parallel_example.ipynb最小测试用例验证安装是否成功很好用tests/test_basic.pytorch.hub 加载入口hubconf.py版本与依赖声明pyproject.toml动手验证 先pip install silero-vad跑上面的 3 行脚本拿到第一组时间戳。结果不准时优先动threshold和sampling_rate这两个参数。现在就拿一段自己的音频跑一遍print(stamps)一眼就能看出它切得准不准。【免费下载链接】silero-vadSilero VAD: pre-trained enterprise-grade Voice Activity Detector项目地址: https://gitcode.com/GitHub_Trending/si/silero-vad创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表