faster-whisper 语音转文字指南:CTranslate2 推理引擎带来 4 倍提速
2026/9/5 23:28:52 网站建设 项目流程

faster-whisper 语音转文字指南:CTranslate2 推理引擎带来 4 倍提速

【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper

如果你的团队还在逐条转写会议录音,值得先看看 faster-whisper。它是基于 CTranslate2 推理引擎重写的 OpenAI Whisper。识别准确率不变,速度最多快 4 倍,占用的内存更少。这篇文章从真实场景出发,带你走完选型、提速和排坑的完整路径。

先想想:哪些活适合交给它

三类任务最值得做:

  • 把一个月的会议录音批量转成可检索的文字
  • 给视频补带时间戳的字幕
  • 在本机离线转录,音频不用出内网

它是一个 Python 包,不需要单独装 FFmpeg,音频解码由内置的 PyAV 完成,只需 Python 3.9 以上。一条命令就能装好:

pip install faster-whisper

装好后直接转录,十几行以内就能出结果:

from faster_whisper import WhisperModel model = WhisperModel("small", device="cpu", compute_type="int8") segments, info = model.transcribe("audio.mp3") print(info.language, [s.text for s in segments])

这一节的结论:一条命令起步,上面三个场景都能直接套用。

选对模型尺寸与计算类型

模型尺寸决定速度和精度的平衡:tiny 最快,适合实时草稿;small 通用均衡;medium 偏专业;large-v3 精度最高。

官方基准用 13 分钟音频做了对比。GPU 上跑 large-v2:fp16 用时 1 分 03 秒,显存约 4.5GB;换成 int8 量化只要 59 秒,显存降到 2.9GB。也就是说量化后速度不降,内存大约省掉三分之一。

# GPU 上用 float16 WhisperModel("large-v3", device="cuda", compute_type="float16") # 纯 CPU 机器用 int8 WhisperModel("small", device="cpu", compute_type="int8")

这一节的结论:精度优先选 large-v3,机器紧张就 small 加 int8。

长音频跑满 GPU:用批量推理

默认的model.transcribe一次处理一个片段,GPU 常有空转。长音频可以改用BatchedInferencePipeline,把多个片段并行喂进去,参数直接传batch_size

效果对比同一份 13 分钟音频:GPU 上batch_size=8时 17 秒完成,是单条流水的 4 倍速,代价是显存升到 6GB 左右。CPU 上batch_size=8也能把 small 模型从 2 分 37 秒压到 1 分 06 秒,int8 量化下是 51 秒。

这一节的结论:长音频、多文件场景先想批量模式,显存不够再降batch_size

⚠️ 容易踩的三个坑

  1. transcribe返回的是生成器,遍历它才真正开始转录。忘了list(segments),你会以为秒出结果,其实一行都没跑。
  2. 新版 ctranslate2 只支持 CUDA 12 加 cuDNN 9。你的环境是 CUDA 11,就锁版本pip install ctranslate2==3.24.0,否则 GPU 起不来。
  3. vad_filter=True默认很保守,只过滤超过 2 秒的静音。想更激进地删静音,传vad_parameters=dict(min_silence_duration_ms=500)

更完整的参数说明在 faster_whisper/transcribe.py 里,每个参数都有注释。

这一节的结论:多数"转不出来"或"比想象中慢"的问题,根源都在这三处。

✅ 行动清单

  1. 先跑pip install faster-whisper,用 small 加 int8 转一段真实音频
  2. 上 GPU 换 large-v3 加 float16,对比一次准确率差异
  3. 长音频加BatchedInferencePipeline,记录一下显存峰值
  4. 术语识别不准时,用initial_prompthotwords注入领域词汇
  5. 要容器化部署,参考 docker/Dockerfile 的环境配置

【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询