Insanely Fast Whisper 模型选择:large-v3 与 distil-large-v2,98 秒转完 150 分钟
【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper
音频转文字时,模型选大了精度上去了,可显存先崩了。用 Insanely Fast Whisper 跑长音频,到底该上 large-v3 还是切到 distil-large-v2?选错了,150 分钟的录音要么挂着等半小时,要么直接 OOM。
项目速览:把 Whisper 跑出极限速度的终端 CLI
insanely-fast-whisper 是一个面向终端的语音转写 CLI,底层用 Transformers + Optimum + flash-attn 把 Whisper 提速到极限。官方在 A100 80GB 上测得 150 分钟音频最快 98 秒转完,大文件转写不用干等。核心代码在 src/insanely_fast_whisper/,CLI 入口是 cli.py,想自己调参直接看 README.md 的基准表,insanely_fast_whisper_colab.ipynb 有完整示例。
核心机制拆解:换模型 + 开 FA2,速度差能到 10 倍
结论先行:同一个 CLI,选对模型、开 Flash Attention 2,速度差能到 10 倍。下面从三个维度拆开看。
转录速度:98 秒 vs 19 分钟
基准全在 README.md 的 A100 80GB 测试里(150 分钟音频):
| 配置 | 耗时 |
|---|---|
| large-v3 fp32 | ~31 min |
| large-v3 fp16 + batching[24] + FA2 | ~1 min 38 sec |
| distil-large-v2 fp16 + batching[24] + FA2 | ~1 min 18 sec |
large-v3 开 FA2 后从 31 分钟压到 98 秒,提速近 19 倍;distil 版再快 20 秒。
资源占用:3.09G 权重是硬门槛
large-v3 权重文件是 3.09G(见 insanely_fast_whisper_colab.ipynb 下载日志model.safetensors: 100% 3.09G/3.09G),fp16 加载还要叠加 batch 缓冲。默认--batch-size 24是为大显存调的,显存紧就得手动调小。distil-large-v2 参数更少、权重更小,同等配置下占用更低。
输出质量:精度换速度
large-v3 是 OpenAI 旗舰版,多语言、低音质、专业术语场景更稳。distil-large-v2 是蒸馏版,牺牲少量精度换速度,英文场景差距很小。--language不填走自动检测,--timestamp支持chunk/word两档。
选型决策表:按显存和精度需求对号入座
| 维度 | large-v3 | distil-large-v2 |
|---|---|---|
| 权重体积 | 3.09G | 更小 |
| 速度(FA2 / 150min) | ~1min38s | ~1min18s |
| 精度 | 旗舰,多语言强 | 蒸馏版,英文够用 |
| 显存门槛 | 高 | 较低 |
| 典型场景 | 法律/学术/多语言 | 实时字幕/批量吞吐 |
✅ 如果你要处理多语言、专业术语或低音质音频,就选 large-v3;如果你追求实时性、跑批量或显存有限,就选 distil-large-v2。
三步跑通:两条命令上手
先装 CLI。pipx会把它隔离进独立虚拟环境,装完直接得到insanely-fast-whisper命令。
pipx install insanely-fast-whisper跑 large-v3(默认模型),加--flash True开 FA2。预期看到进度条,结果落到output.json。
insanely-fast-whisper --file-name ted_60.wav --flash True换 distil 模型,显存吃紧时把--batch-size调小防 OOM。
insanely-fast-whisper --model-name distil-whisper/large-v2 --file-name ted_60.wav --batch-size 8 # 显存不足就调小容易踩的坑
⚠️OOM 显存不足:默认--batch-size 24是给大显存调的,小卡直接报 OOM。调小--batch-size(Mac 上建议 4,约 12GB 显存),或换 distil 模型。
Windows 报 Torch not compiled with CUDA:根因未明,在虚拟环境里手动装带 CUDA 的 torch(指向官方 CUDA 12.1 wheel 源)即可。
python 3.11 装成旧版本:pipx可能把版本解析错成 0.0.8。加--force --pip-args="--ignore-requires-python"强制装最新版。
收尾
回到开头:显存够就上 large-v3 +--flash True,150 分钟音频 98 秒出结果;显存紧就切 distil-large-v2 保吞吐。想接着出字幕,可以看 convert_output.py 把output.json转成 SRT / VTT。
【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考