Buzz 离线语音转写完全指南:三步跑通 Faster-Whisper 本地转录
2026/9/10 8:42:14 网站建设 项目流程

Buzz 离线语音转写完全指南:三步跑通 Faster-Whisper 本地转录

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

飞机起飞后网络断开,你还得把一小时的访谈录音整理成文字笔记。Buzz 就是为这种时刻准备的离线语音转写工具:它接入 Faster-Whisper,音频全程在你自己的电脑上处理,不依赖网络,速度比原版 Whisper 快 2-4 倍。本文带你从克隆仓库到跑出第一份文本。

准备工作:三步装好依赖

先确认本机装了 Python 3.12(项目在pyproject.toml中锁定了这个版本)以及ffmpeg(用来解码音频)。然后按最短路径走三步:

git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz python -m venv .venv && source .venv/bin/activate pip install -e . pip install faster-whisper

前两条命令克隆仓库并进入目录,第三条建好虚拟环境并激活,第四条按项目清单装齐全部依赖,最后一条单独装上转写引擎 faster-whisper(pip install -e .其实已包含它,单独装一遍可以确认版本就绪)。Windows 用户把激活命令换成venv\Scripts\activate即可。

第一次离线转录:从音频文件到文本

python main.py启动 Buzz。接下来沿一条主线走:

  1. 点击主窗口左上角的+按钮,选中一个音频文件(MP3、WAV、FLAC 等都支持)。
  2. 在弹出的文件转写表单里,Group下拉框选Faster Whisper,选好模型大小。
  3. Language选音频实际语言,留空则自动检测;TaskTranscribe(转录)或Translate to English(翻译成英文)。
  4. OK,任务进入主界面的任务队列,进度条实时刷新。

注意:首次使用某个模型时,Buzz 会先把模型文件下载到本地缓存(Buzz 的 models 目录,可用环境变量BUZZ_MODEL_ROOT改位置),下载完才开始转写。完成后,音频同目录会生成.txt/.srt/.vtt文件,双击任务行即可在查看器里对照播放:

喜欢命令行的话,一条命令也能跑,buzz add是命令行入口(见 buzz/cli.py):

buzz add -m fasterwhisper -s medium -l zh interview.mp3 --txt

按配置挑模型:大多数人直接选哪个

模型大小直接决定速度、内存和磁盘占用,Buzz 内置的各档位体积如下(数据来自 buzz/model_loader.py):

模型下载体积特点
Tiny约 73 MB最快,中文场景准确率一般
Base约 139 MB速度与准确率的平衡点
Small约 462 MB准确率明显提升,CPU 也能跑
Medium约 1.5 GB多数人的最佳选择
Large / Large-v3-turbo约 2.9 GB / 1.6 GB质量最高,吃配置

不用纠结,直接按这个结论选:带 NVIDIA 显卡的笔记本选 Medium;纯 CPU 的办公机选 Base 或 Small;只有专门搭转写机器的场景才碰 Large。选完在偏好设置的 Models 页点Download即可:

进阶调优:只讲三件事

并行处理——什么时候需要:一次丢进很多文件时。改哪里:Buzz 的任务队列默认串行执行,没有公开线程数设置,多文件排队即可。怎么判断已生效:主界面状态列依次从Queued变为In progress,内存不超就是合适档位。

compute_type(计算精度,直接关系速度和内存)——什么时候需要:8GB 内存的机器加载 Medium 吃紧时。改哪里:转写表单勾选Reduce memory usage,Buzz 会自动切到 CPU 的int8或 GPU 的int8_float16。怎么判断已生效:终端日志出现Using int8 compute type,且不再报内存不足。

GPU 加速——什么时候需要:有 NVIDIA 显卡且装了 CUDA 环境。改哪里:不用改,Buzz 默认device=auto自动检测。怎么判断已生效:任务运行时nvidia-smi能看到 GPU 占用,同一文件明显比纯 CPU 快。

避坑指南

模型下载失败——原因:网络不稳,中途断连。处理:Buzz 自带 3 次自动重试,且已下部分保留在缓存里可断点续传,重新点Download即可;反复失败就手动下载对应Systran/faster-whisper-<模型名>仓库的模型包放进 Buzz 的 models 目录。

转录速度慢——原因:CPU 上跑了大模型或精度偏高。处理:勾选Reduce memory usage换 int8 推理,或把模型降到 Small/Base。

结果不准——原因:语言选错、环境噪音大。处理:Language明确选定而非自动检测;换更大一档模型;嘈杂录音先在表单启用语音提取(extract speech)降噪。

收尾

到这里,一台断网的电脑就能完成从录音到带时间戳文本的完整闭环,转写、翻译全程本地执行。更多细节可查 官方文档 docs/,想弄清转写流程的实现可以看 buzz/transcriber/ 目录。现在挑一个手头的音频文件,把 Medium 下下来,跑通你的第一份离线转录 🚀

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询