Buzz 音频转录上手指南:离线 Whisper 语音转文字的完整配置路径
2026/9/6 15:54:08 网站建设 项目流程

Buzz 音频转录上手指南:离线 Whisper 语音转文字的完整配置路径

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款运行在个人电脑上的音频转录工具,基于 OpenAI Whisper 模型,把录音文件、视频和麦克风实时音频转成带时间戳的文字,支持翻译与 SRT、VTT、TXT 导出,整个转录过程在本地完成,属于典型的离线语音转文字方案。

项目定位

Buzz 是一个 PyQt6 桌面应用,核心逻辑在 buzz/transcriber/ 模块中实现。它把语音识别引擎放在用户自己的硬件上运行,而不是把音频上传到云端 API。对处理内部会议、客户通话、课堂录音这类不便外发的音频的团队来说,这是它最主要的价值:文件不出本机、没有按分钟计费,也没有上传大小限制。

引擎层面,Buzz 内置了 5 种转录后端(见 buzz/model_loader.py):Whisper(openai-whisper 原版)、Whisper.cpp(C++ 实现,支持 Vulkan 加速与纯 CPU 运行)、Faster Whisper(面向 Nvidia GPU 的优化实现)、Hugging Face(transformers 实现,可加载 MMS、Parakeet、Qwen3-ASR 等第三方模型),以及可选的 OpenAI API 远程模式。除 Whisper 系模型外,它还支持 YouTube 链接导入、说话人识别、字幕重排(resize)与插件系统(如 AI 摘要、自动分段,见 buzz/plugins/)。

安装与第一次转录

各平台最短安装路径

macOS 与 Windows 到 SourceForge 下载对应安装包即可(macOS 提供 Intel 与 Apple Silicon 两个版本;Windows 安装包未签名,安装提示时选择"更多信息→仍要运行")。Linux 与命令行用户可用包管理器或 PyPI:

# Flatpak flatpak install flathub io.github.chidiwilliams.Buzz # Snap sudo snap install buzz sudo snap connect buzz:password-manager-service # PyPI(需要 Python 3.12 与系统 ffmpeg) pip install buzz-captions python -m buzz

PyPI 方式在 Linux 上可能还需补装系统库(ffmpeg、portaudio 等),详见 安装文档。

走完一次完整转录

  1. Ctrl/Cmd + O(或工具栏"+"按钮)导入音频或视频文件,也支持直接粘贴 YouTube 链接。
  2. 在任务行选择三项参数:任务类型(转录 Transcribe / 翻译成英文 Translate)、语言(留空则自动检测)、模型与档位。
  3. 点击 Run,状态列变为 Completed 即完成;首次选用某档模型时会自动下载,进度显示在界面上。
  4. 双击任务行打开转录查看器:左侧按段落列出起止时间戳,可随音频播放同步滚动、0.5~2 倍速调节,Ctrl+F全文搜索,Ctrl+←/→以 0.5 秒步进微调段落时间。

  1. 点导出按钮选择 TXT、SRT 或 VTT,文件名可按偏好里的模板生成(支持{{ input_file_name }}{{ task }}{{ date_time }}{{ language }}{{ model_size }}等变量,见 偏好设置文档)。

核心能力拆解

离线运行与模型缓存迁移

模型文件只下载一次,存放在用户缓存目录(Linux 为~/.cache/Buzz,macOS 为~/Library/Caches/Buzz,Windows 为%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache)。完全无网的主机也能使用:在有网机器上下载好模型,把整个 models 目录拷到离线机器的同一路径即可;仓库自带 scripts/download-models.py 可批量准备离线模型缓存。用BUZZ_MODEL_ROOT环境变量可改模型存储位置。

多后端与硬件加速

同一档位可在不同后端间切换,对应不同硬件:有 6GB 以上显存的 Nvidia 显卡选 Faster Whisper,速度比原版 Whisper 高一个数量级;无独显或想省显存选 Whisper.cpp,纯 CPU 也能跑,Apple Silicon 上可走 CoreML 编码器,其他显卡可启用 Vulkan。PyPI 安装的版本需自行匹配 CUDA 12 版 torch 才能用上 GPU(README 中有现成命令);显卡有问题时设BUZZ_FORCE_CPU=true强制回退 CPU。显存吃紧时设BUZZ_REDUCE_GPU_MEMORY=true启用 8bit 量化模型。

实时录音与演示窗口

录音模式从麦克风逐句出文字,适合会议与讲座;配套的演示窗口(presentation window)可投到大屏,方便现场观看。实时结果还能落盘为纯文本文件供 OBS 等软件消费;BUZZ_UPLOAD_URL则支持把实时文稿 POST 到自建服务展示。追加策略有三种:向下追加、向上追加、追加并回改(最后一种会修正上一句尾部,消耗更多算力)。转录中遇到专有名词,在 Advanced 的 Initial prompt 里写上人名、术语,能显著减少误拼。

批量与命令行

两个自动化入口:偏好设置里开启 watch folder,放进目录的新文件自动排队转录;命令行buzz add支持脚本化,例如用 Whisper.cpp small 模型转录一个 MP4 并同时导出 SRT 与 VTT:

buzz add --model-type whispercpp --model-size small --srt --vtt /path/to/video.mp4

完整参数(语言代码、initial prompt、--word-timestamps--hide-gui等)见 CLI 文档。

参数与选型建议

档位体积取自 buzz/model_loader.py 中的实测值,可作为磁盘与显存规划依据:

档位模型文件体积定位
tiny / tiny.en约 73 MB快速试跑、实时录音的低延迟选择
base / base.en约 139 MB日常草稿
small / small.en约 462 MB速度与精度的常规平衡点
medium / medium.en约 1.5 GB正式交付内容
large / large-v2 / large-v3约 2.9 GB精度优先;v3 个别情况会"幻觉"补词,v2 更稳
large-v3-turbo约 1.6 GB大模型速度下的折中档

其余三个参数的判断口径:

  • 语言:官方使用文档明确建议尽量指定语言而非自动检测,自动检测在短音频上容易判错;.en后缀模型只识别英语。
  • 任务:原语言出文字选 Transcribe;需要英文文稿(如外语访谈归档)选 Translate。
  • 词级时间戳:默认关闭。只有做卡拉OK式逐词字幕才打开,打开后每词一行,需配合查看器的 resize 功能合并成字幕行。

常见问题排查

  • 转录速度慢:原因是模型档位与后端不匹配。换成更小的档位,或改用 Whisper.cpp 后端;Whisper.cpp 线程数默认是 CPU 核心数的一半,16 线程机器可试BUZZ_WHISPERCPP_N_THREADS=8约提速 15%,再往上反而变慢。
  • 显存/内存吃紧:设BUZZ_REDUCE_GPU_MEMORY=true使用量化模型,或改用 CPU 可跑的 Whisper.cpp;并发任务过多时减少同时运行的转录行数。
  • 个别文件无法导入:Buzz 依赖 ffmpeg 解析容器格式,先确认 ffmpeg 已安装且版本较新,再确认文件本身未被截断损坏。
  • 录音没声音或报 PaErrorCode-9999:多为系统麦克风权限问题。Windows 检查"设置→隐私→麦克风"中 Buzz 的开关,并留意杀毒软件的拦截。
  • 模型下载后启动即崩溃:多为下载不完整。在"偏好→模型"中删除该模型重新下载;另外 Buzz 要求 CPU 支持 AVX2,过老的机器无法运行。
  • 实时录音延迟大:实时模式吃模型推理延迟,换 tiny/base 档 + Whisper.cpp 后端是常见解法,安静环境、贴近麦克风能进一步减少断句错误。更多问题见 FAQ 文档。

典型使用场景

  • 会议记录:会议前在 watch folder 里备好当周目录,会后录音丢进去自动转录;任务行的 Initial prompt 里填入参会人姓名与产品名;结束后导出 TXT 归档。
  • 视频字幕:导入成片,选 small 或 medium 档,开启 Word-Level Timings 后在查看器里用 resize 调整切分,导出 SRT 或 VTT,直接拖进剪辑软件。
  • 访谈与播客整理:多人对话开启说话人识别(基于 whisper-diarization),再逐段修正说话人标签;长音频按主题拆段后,用BUZZ_PARAGRAPH_SPLIT_TIME控制导出 TXT 时的段落空行(默认 2 秒静音分一段)。

小结

Buzz 的定位是"把 Whisper 装进本地工作流":离线隐私、多后端多档位、GUI 与 CLI 双入口、可插件化,MIT 协议开源,无使用费。适合把它当作团队内部的字幕与文稿生产线,而不是按分钟计费的云服务替代。

  • 使用文档:docs/docs/
  • 转录核心模块:buzz/transcriber/
  • 插件系统:buzz/plugins/
  • 偏好与环境变量:docs/docs/preferences.md

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询