Buzz 离线音频转录指南:本地跑通 Whisper 的完整上手路径
2026/9/6 16:37:33 网站建设 项目流程

Buzz 离线音频转录指南:本地跑通 Whisper 的完整上手路径

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款离线音频转录工具,基于 OpenAI Whisper 模型,在个人电脑上本地完成音频与视频的转写和翻译。与云端转录服务相比,你的录音不需要上传到任何服务器,也没有 API 调用次数和文件大小的限制;它同时提供图形界面、命令行和监听文件夹三种入口,覆盖从单条录音到批量文件的处理需求。

什么场景适合用 Buzz

  • 适合:会议录音、讲座、播客需要本地转文字且在意隐私的用户;需要批量产出 SRT/VTT 字幕的用户;想用脚本管理大量音频文件的用户。
  • 不太适合:完全依赖云端 API、不想在本机投入算力的场景(Buzz 的 openaiapi 后端也需要联网和 API key,其余模式均为本地推理)。

Buzz 离线安装与首次转录

三个平台都有图形界面安装包。macOS 下载.dmg后双击安装;Windows 双击安装程序,由于应用未签名会弹出"不 recognize 的应用"警告,点"更多信息"再"仍要运行"即可。Linux 用户二选一:

flatpak install flathub io.github.chidiwilliams.Buzz

sudo snap install buzz

习惯命令行的话,用 Python 3.12 环境加 ffmpeg 也可以:

pip install buzz-captions python -m buzz

首次使用某个模型时需要联网下载模型文件,界面会显示下载进度,之后本地复用。装好后打开主界面,点左上角的加号把音频或视频文件加入任务列表,右侧选择语言(默认自动检测,支持 99 种语言)、模型和任务类型(转录或翻译为英文),然后启动任务。完成后双击列表中的条目进入查看器,可以播放音频对照文字、搜索、直接编辑文本,最后导出为 TXT、SRT 或 VTT。

Buzz 典型使用场景:实时转录、字幕制作与批处理

会议与讲座的实时文字记录。选择实时录音模式、指定麦克风后按下录音按钮,界面会随语音持续刷新转录内容;Buzz 还带一个独立的演示窗口,讲课时可以把转录投在屏幕上。你得到的是散会即可保存、稍加整理的文字稿。

视频字幕制作。导入视频文件转录后,在查看器里逐段修改文字和时间戳(可开启单词级时间戳),导出 SRT 或 VTT 后直接导入视频编辑软件使用。

批量与自动化处理。偏好设置中配置监听文件夹后,新丢入的音频会自动排队转录;配合buzz add 文件 --srt --vtt --hide-gui这类命令行用法,可以把整个流程写进脚本,隐藏主窗口在后台跑。

嘈杂多人音频。转录前可先做语音分离,从混音中把人声提出来以提升识别准确度;转录完成后再用说话人识别功能标注每一段是谁说的,减少人工分段的工作量。

Buzz 模型与参数怎么选

  • 模型档位:small 是速度与准确率的平衡点;重要材料上 medium 或 large,低配设备用 tiny 或 base 先跑通流程。
  • 语言能确定的就直接指定,比自动检测更稳;含专有名词、人名时,在初始提示(prompt)里预填这些词可以改善识别。
  • 长文件转录前先降噪,或在选项里启用转录前语音分离;NVIDIA 显卡选 CUDA 后端,集显或 Apple Silicon 可用 Whisper.cpp 的 Vulkan / 原生加速路径。

Buzz 常见问题排查

现象原因处理
Windows 安装时提示"未识别的应用"安装程序未做代码签名点"更多信息"→"仍要运行"
导入文件失败或音频无声音缺少 ffmpeg 或文件本身损坏安装最新版 ffmpeg,换一个文件验证
转录速度明显偏慢模型过大、开启了单词级时间戳、纯 CPU 推理换小一档模型,关闭单词级时间戳,启用 GPU / Vulkan 后端
首次运行某模型卡很久首次使用该模型需联网下载模型文件保持网络畅通,观察界面中的模型下载进度

Buzz 的边界与局限

Buzz 的本地模式依赖你本机的算力,large 档模型在内存和时间上的开销都不小;混合语种、强噪声、远距离收音的内容仍会有明显错漏,交付前需要人工校对。如果你的场景要求极低延迟的实时字幕流,Buzz 的逐段刷新节奏并不为此设计。

Buzz 文档与源码入口

  • 官方文档中的 CLI 参数参考
  • 转录核心模块(各 Whisper 后端的实现)
  • 插件系统(AI 摘要、自动调整转录等)
  • 数据库层(任务与转录片段的存取)

想跟踪最新功能,可以克隆仓库查看开发版本:git clone https://gitcode.com/GitHub_Trending/buz/buzz

写在最后

Buzz 把 Whisper 的离线转写能力封装成了开箱即用的桌面工具。下一步:按上面的命令装好它,丢一段会议录音进去,导出你的第一份 SRT。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询