Insanely Fast Whisper 模型选型指南:30 秒看懂 large-v3 与 distil-large-v2 怎么选
【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper
把一段两个半小时的录音丢进本地转写流水线之前,你可能要先回答一个问题:Whisper 模型选 openai/whisper-large-v3 还是蒸馏版 distil-large-v2?这篇文章基于 Insanely Fast Whisper 仓库的基准数据与 CLI 源码,从速度、体积、适用环境三个维度对比两者,帮你直接下结论。
一屏速查:large-v3 与 distil-large-v2 核心差异
| 维度 | large-v3 | distil-large-v2 |
|---|---|---|
| 模型定位 | OpenAI 旗舰大模型,CLI 的默认模型(--model-name默认openai/whisper-large-v3) | 蒸馏版本,需显式指定--model-name distil-whisper/large-v2 |
| 下载体积 | model.safetensors约 3.09G(Colab 示例中的下载日志) | 小于 large-v3,无固定标注数值 |
| 转录速度(A100-80GB,150 分钟音频,fp16 + batching[24] + Flash Attention 2) | 约 1 分 38 秒 | 约 1 分 18 秒 |
| 不加速时的参考值 | fp32 下约 31 分钟;fp16 + batching + bettertransformer 约 5 分钟 | fp16 + batching + bettertransformer 约 3 分 16 秒 |
| 支持任务 | transcribe / translate,chunk 或 word 级时间戳,可选说话人分离 | 同左,CLI 通用参数均可用,仅模型名不同 |
速度数字全部来自 README.md 中的 A100-80GB 基准表格,同硬件、同配置下对比才有意义。
为什么 distil 更快:参数量与蒸馏的关系
distil-whisper 是对 whisper-large 系列做蒸馏得到的版本,通过压缩解码器结构减少了参数量,每帧音频的推理计算量更小,所以在相同的 fp16 + 批量 + Flash Attention 2 配置下,150 分钟音频能比 large-v3 快出约 20 秒。代价是容量更小:遇到低音质、口音重或跨语言混杂的录音时,参数更多、语言覆盖更全的 large-v3 通常表现更稳。简单说,就是用一部分泛化能力换推理速度。
跑一遍:insanely-fast-whisper 模型安装与调用命令
先装 CLI(macOS 用--device-id mps指定 Apple Silicon 设备):
pipx install insanely-fast-whisper再分别用两个模型转录同一个文件,--flash True开启 Flash Attention 2 提速:
insanely-fast-whisper --file-name ted_60.wav --flash True insanely-fast-whisper --file-name ted_60.wav --model-name distil-whisper/large-v2 --flash True两条命令都会把结果写进output.json,包含speakers、chunks、text三个字段(结构定义见 src/insanely_fast_whisper/utils/result.py),即"分块 + 时间戳 + 全文"。如果 Mac 上 OOM,把--batch-size降到 4 一般就能跑,约占用 12GB 显存,README 的 FAQ 有说明。
选型建议:按你的场景对号入座
- 如果你的场景是归档长讲座、访谈这类对准确率敏感的音频,就选 large-v3;它正是 CLI 的默认模型,不加参数直接用即可。
- 如果是批量转录会议录音、追求更高吞吐和更短等待,就选 distil-large-v2,在 A100 上它能比 large-v3 快约 20 秒 / 150 分钟音频。
- 如果你的机器显存紧张、经常要靠调低
--batch-size才不 OOM,就选 distil 版本,它对显存的占用更友好。 - 如果需要先零成本评估效果再定,就用
pipx run insanely-fast-whisper --file-name <你的文件> --help查看全部参数,默认配置先跑一次 large-v3,不满意再换模型名。
所有可调参数(设备号、时间戳粒度、说话人数量等)都可以在--help输出里查到,源码入口是 src/insanely_fast_whisper/cli.py;想在没有 GPU 的环境复现对比,可以看 notebooks/ 目录下的 T4 基准 Notebook。建议先收藏 README.md 里的完整基准表,作为你调参时的参照系。
觉得有用的话,不妨点个关注,后续会更新这个项目说话人分离(diarization)参数的实操教程。
【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考