Silero VAD 到底怎么用?3行代码跑通语音活动检测
【免费下载链接】silero-vadSilero VAD: pre-trained enterprise-grade Voice Activity Detector项目地址: https://gitcode.com/GitHub_Trending/si/silero-vad
Silero VAD 是一个预训练语音活动检测(Voice Activity Detection,VAD)模型:给它一段音频,它告诉你哪些时间段有人说话。模型体积约 2MB,CPU 单线程处理一个 32 毫秒的音频块不到 1 毫秒,MIT 协议,无注册、无密钥、无遥测。
Silero VAD 解决什么实际问题 🎯
做语音助手的人都知道:识别服务 24 小时对着麦克风,安静时段也在空烧算力;做播客、会议转录的,又得先从 3 小时录音里剪掉沉默片段。Silero VAD 的定位就一句话——在整条语音链路最前面,回答"现在到底有没有人说话",然后把答案(起止时间戳)交给后面的 ASR 或处理流程。
部署前确认这几个硬指标 📋
| 指标 | 数值 |
|---|---|
| 模型体积 | JIT 模型约 2 MB |
| 依赖 | Python 3.8+、torch ≥ 1.12、torchaudio ≥ 0.12;ONNX 路线另需 onnxruntime ≥ 1.16.1 |
| 速度 | 单核 CPU 处理 32ms 音频块 < 1ms,批量或 GPU 可再加速 |
| 采样率 | 8000 Hz 和 16000 Hz |
| 许可证 | MIT |
| 平台 | PyTorch / ONNX 两大运行时覆盖的环境均可 |
最快跑通:3行代码拿到时间戳 🚀
先一条命令安装:
pip install silero-vad下面这段脚本加载模型、读音频、输出语音段(如果想在仓库里直接验证,clone 后可以用自带的 tests/data/test.wav 当输入,仓库地址:git clone https://gitcode.com/GitHub_Trending/si/silero-vad):
from silero_vad import load_silero_vad, read_audio, get_speech_timestamps model = load_silero_vad() wav = read_audio('your_audio_file.wav') stamps = get_speech_timestamps(wav, model, return_seconds=True) print(stamps)预期看到一叠字典,形如[{'start': 1.24, 'end': 3.87}, ...],每对数字就是一段语音的起止秒数——能打印出非空结果,说明环境已跑通。
工作原理:32 毫秒切一块,逐块打概率 🎧
它不"听完"整段音频再下结论,而是把音频切成 512 个采样点(16k 下约 32ms)的小块,每块输出一个 0~1 的概率:"这段像人话的程度"。类比物业保安:每 32 毫秒往走廊瞄一眼,记下"像有人说话"还是"只是噪音"。
后处理层再把连续的"像说话"记录拼成一段语音:比 250ms 还短的闪断直接丢掉(防止咳嗽、拍桌被当成话),遇到足够长的静音就切段。模型内部还带状态记忆,下一块不用从头听——像连续读同一篇文章,这样麦克风流式输入时才能做到低延迟。
进阶路线:轻量、部署、调优三档,按需跳读 🛠
轻量使用:默认参数(阈值 0.5)在大多数音频上够用,CPU 场景建议torch.set_num_threads(1)省掉多线程开销。麦克风实时流用VADIterator配合collect_chunks做分片输出,完整写法见 examples/pyaudio-streaming/。
生产部署:不想引入 PyTorch 依赖时切 ONNX,需先pip install onnxruntime:
model = load_silero_vad(onnx=True, opset_version=16)某些 CPU 上 ONNX 比 JIT 快 4~5 倍。非 Python 技术栈有现成示例:C++、Rust、Go、Java、C#,Intel 加速参考 examples/openvino/。各变体模型文件(含半精度silero_vad_half.onnx)都放在 src/silero_vad/data/。
调优:有自有音频集时,用 tuning/search_thresholds.py 自动搜阈值,用 tuning/tune.py 在自己的数据上微调(配置项见 tuning/config.yml)。min_speech_duration_ms、max_speech_duration_s、speech_pad_ms等切段参数的定义都在 src/silero_vad/utils_vad.py。
适用与不适用场景对照 ✅
适合:实时语音链路(会议、通话、唤醒前端)、长音频批量切分与清洗、只有 CPU 的边缘设备、8k 电话语音。
不适合:它只回答"有没有人说话"——不做说话人区分(谁在说),也不做语音识别(说了什么);silero_vad_16k_op15.onnx只支持 16k 采样率;KTV、街头采访这类强噪声场景,默认阈值容易漏报或误报,得先跑一遍阈值搜索或微调。
避坑清单:四个高频问题的解法 ⚠️
- 现象:
read_audio报找不到音频后端 →原因:torchaudio 读音频需要后端支持 →解法:pip install soundfile(或装 ffmpeg / sox,三选一)。 - 现象:结果全空或时间对不上 →原因:音频是 8k,但
get_speech_timestamps默认按 16000 处理 →解法:重采样到 16k,或显式传sampling_rate=8000。 - 现象:噪声环境误报多 →原因:阈值 0.5 对噪声偏宽松 →解法:把
threshold提到 0.7~0.9,或用 tuning/ 工具在自己的数据上搜阈值。 - 现象:ONNX 直接调用报 "Provided number of samples is ..." →原因:每次输入必须是恰好 512 个采样点(8k 为 256)→解法:按 512 切片,或直接用
VADIterator这类封装好的入口。
仓库资源地图 🧭
- 官方交互演示:silero-vad.ipynb
- 多路并行批处理:examples/parallel_example.ipynb
- 最小测试用例(验证安装是否成功很好用):tests/test_basic.py
- torch.hub 加载入口:hubconf.py
- 版本与依赖声明:pyproject.toml
动手验证 🏁
- 先
pip install silero-vad跑上面的 3 行脚本,拿到第一组时间戳。 - 结果不准时,优先动
threshold和sampling_rate这两个参数。 - 现在就拿一段自己的音频跑一遍,
print(stamps)一眼就能看出它切得准不准。
【免费下载链接】silero-vadSilero VAD: pre-trained enterprise-grade Voice Activity Detector项目地址: https://gitcode.com/GitHub_Trending/si/silero-vad
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考