Insanely Fast Whisper 模型选型指南:30 秒看懂 large-v3 与 distil-large-v2 怎么选
2026/9/13 23:32:40 网站建设 项目流程

Insanely Fast Whisper 模型选型指南:30 秒看懂 large-v3 与 distil-large-v2 怎么选

【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper

把一段两个半小时的录音丢进本地转写流水线之前,你可能要先回答一个问题:Whisper 模型选 openai/whisper-large-v3 还是蒸馏版 distil-large-v2?这篇文章基于 Insanely Fast Whisper 仓库的基准数据与 CLI 源码,从速度、体积、适用环境三个维度对比两者,帮你直接下结论。

一屏速查:large-v3 与 distil-large-v2 核心差异

维度large-v3distil-large-v2
模型定位OpenAI 旗舰大模型,CLI 的默认模型(--model-name默认openai/whisper-large-v3蒸馏版本,需显式指定--model-name distil-whisper/large-v2
下载体积model.safetensors约 3.09G(Colab 示例中的下载日志)小于 large-v3,无固定标注数值
转录速度(A100-80GB,150 分钟音频,fp16 + batching[24] + Flash Attention 2)约 1 分 38 秒约 1 分 18 秒
不加速时的参考值fp32 下约 31 分钟;fp16 + batching + bettertransformer 约 5 分钟fp16 + batching + bettertransformer 约 3 分 16 秒
支持任务transcribe / translate,chunk 或 word 级时间戳,可选说话人分离同左,CLI 通用参数均可用,仅模型名不同

速度数字全部来自 README.md 中的 A100-80GB 基准表格,同硬件、同配置下对比才有意义。

为什么 distil 更快:参数量与蒸馏的关系

distil-whisper 是对 whisper-large 系列做蒸馏得到的版本,通过压缩解码器结构减少了参数量,每帧音频的推理计算量更小,所以在相同的 fp16 + 批量 + Flash Attention 2 配置下,150 分钟音频能比 large-v3 快出约 20 秒。代价是容量更小:遇到低音质、口音重或跨语言混杂的录音时,参数更多、语言覆盖更全的 large-v3 通常表现更稳。简单说,就是用一部分泛化能力换推理速度。

跑一遍:insanely-fast-whisper 模型安装与调用命令

先装 CLI(macOS 用--device-id mps指定 Apple Silicon 设备):

pipx install insanely-fast-whisper

再分别用两个模型转录同一个文件,--flash True开启 Flash Attention 2 提速:

insanely-fast-whisper --file-name ted_60.wav --flash True insanely-fast-whisper --file-name ted_60.wav --model-name distil-whisper/large-v2 --flash True

两条命令都会把结果写进output.json,包含speakerschunkstext三个字段(结构定义见 src/insanely_fast_whisper/utils/result.py),即"分块 + 时间戳 + 全文"。如果 Mac 上 OOM,把--batch-size降到 4 一般就能跑,约占用 12GB 显存,README 的 FAQ 有说明。

选型建议:按你的场景对号入座

  • 如果你的场景是归档长讲座、访谈这类对准确率敏感的音频,就选 large-v3;它正是 CLI 的默认模型,不加参数直接用即可。
  • 如果是批量转录会议录音、追求更高吞吐和更短等待,就选 distil-large-v2,在 A100 上它能比 large-v3 快约 20 秒 / 150 分钟音频。
  • 如果你的机器显存紧张、经常要靠调低--batch-size才不 OOM,就选 distil 版本,它对显存的占用更友好。
  • 如果需要先零成本评估效果再定,就用pipx run insanely-fast-whisper --file-name <你的文件> --help查看全部参数,默认配置先跑一次 large-v3,不满意再换模型名。

所有可调参数(设备号、时间戳粒度、说话人数量等)都可以在--help输出里查到,源码入口是 src/insanely_fast_whisper/cli.py;想在没有 GPU 的环境复现对比,可以看 notebooks/ 目录下的 T4 基准 Notebook。建议先收藏 README.md 里的完整基准表,作为你调参时的参照系。

觉得有用的话,不妨点个关注,后续会更新这个项目说话人分离(diarization)参数的实操教程。

【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询