Insanely Fast Whisper 模型选择:large-v3 与 distil-large-v2,98 秒转完 150 分钟
2026/9/13 14:09:28 网站建设 项目流程

Insanely Fast Whisper 模型选择:large-v3 与 distil-large-v2,98 秒转完 150 分钟

【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper

音频转文字时,模型选大了精度上去了,可显存先崩了。用 Insanely Fast Whisper 跑长音频,到底该上 large-v3 还是切到 distil-large-v2?选错了,150 分钟的录音要么挂着等半小时,要么直接 OOM。

项目速览:把 Whisper 跑出极限速度的终端 CLI

insanely-fast-whisper 是一个面向终端的语音转写 CLI,底层用 Transformers + Optimum + flash-attn 把 Whisper 提速到极限。官方在 A100 80GB 上测得 150 分钟音频最快 98 秒转完,大文件转写不用干等。核心代码在 src/insanely_fast_whisper/,CLI 入口是 cli.py,想自己调参直接看 README.md 的基准表,insanely_fast_whisper_colab.ipynb 有完整示例。

核心机制拆解:换模型 + 开 FA2,速度差能到 10 倍

结论先行:同一个 CLI,选对模型、开 Flash Attention 2,速度差能到 10 倍。下面从三个维度拆开看。

转录速度:98 秒 vs 19 分钟

基准全在 README.md 的 A100 80GB 测试里(150 分钟音频):

配置耗时
large-v3 fp32~31 min
large-v3 fp16 + batching[24] + FA2~1 min 38 sec
distil-large-v2 fp16 + batching[24] + FA2~1 min 18 sec

large-v3 开 FA2 后从 31 分钟压到 98 秒,提速近 19 倍;distil 版再快 20 秒。

资源占用:3.09G 权重是硬门槛

large-v3 权重文件是 3.09G(见 insanely_fast_whisper_colab.ipynb 下载日志model.safetensors: 100% 3.09G/3.09G),fp16 加载还要叠加 batch 缓冲。默认--batch-size 24是为大显存调的,显存紧就得手动调小。distil-large-v2 参数更少、权重更小,同等配置下占用更低。

输出质量:精度换速度

large-v3 是 OpenAI 旗舰版,多语言、低音质、专业术语场景更稳。distil-large-v2 是蒸馏版,牺牲少量精度换速度,英文场景差距很小。--language不填走自动检测,--timestamp支持chunk/word两档。

选型决策表:按显存和精度需求对号入座

维度large-v3distil-large-v2
权重体积3.09G更小
速度(FA2 / 150min)~1min38s~1min18s
精度旗舰,多语言强蒸馏版,英文够用
显存门槛较低
典型场景法律/学术/多语言实时字幕/批量吞吐

✅ 如果你要处理多语言、专业术语或低音质音频,就选 large-v3;如果你追求实时性、跑批量或显存有限,就选 distil-large-v2。

三步跑通:两条命令上手

先装 CLI。pipx会把它隔离进独立虚拟环境,装完直接得到insanely-fast-whisper命令。

pipx install insanely-fast-whisper

跑 large-v3(默认模型),加--flash True开 FA2。预期看到进度条,结果落到output.json

insanely-fast-whisper --file-name ted_60.wav --flash True

换 distil 模型,显存吃紧时把--batch-size调小防 OOM。

insanely-fast-whisper --model-name distil-whisper/large-v2 --file-name ted_60.wav --batch-size 8 # 显存不足就调小

容易踩的坑

⚠️OOM 显存不足:默认--batch-size 24是给大显存调的,小卡直接报 OOM。调小--batch-size(Mac 上建议 4,约 12GB 显存),或换 distil 模型。

Windows 报 Torch not compiled with CUDA:根因未明,在虚拟环境里手动装带 CUDA 的 torch(指向官方 CUDA 12.1 wheel 源)即可。

python 3.11 装成旧版本pipx可能把版本解析错成 0.0.8。加--force --pip-args="--ignore-requires-python"强制装最新版。

收尾

回到开头:显存够就上 large-v3 +--flash True,150 分钟音频 98 秒出结果;显存紧就切 distil-large-v2 保吞吐。想接着出字幕,可以看 convert_output.py 把output.json转成 SRT / VTT。

【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询