Buzz 离线语音转录:把本地音频转成可编辑字幕的桌面工具
2026/9/7 9:25:14 网站建设 项目流程

Buzz 离线语音转录:把本地音频转成可编辑字幕的桌面工具

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款运行在个人电脑上的离线语音转录工具,基于 OpenAI Whisper 模型,能把本地音频、视频文件转写成文字,并翻译成目标语言。它适合需要在本机处理录音、制作字幕、整理访谈内容的新手、内容创作者和研究人员——处理过程不经过云端服务器,结果直接保存在本机。

从录音文件到字幕文件的操作流程

Buzz 的主界面是一个任务队列:把文件拖入或点击「+」导入,右侧可逐行选择模型和任务类型(转录或翻译),随后状态列显示排队、进行中(含百分比)或已完成耗时。

任务完成后双击结果,会打开转录查看器:每句文字带起止时间戳,底部有播放进度条,可逐句定位、搜索、调整播放速度。查看器顶部提供 View、Export、Translate、Resize 四个入口,导出支持 TXT、SRT、VTT 三种格式。

对字幕创作者,Resize 入口能调整字幕粒度:可设定目标字幕长度,按时间间隔合并(Merge by gap)、按标点分割(Split by punctuation)、按最大长度分割,适合把过密的短字幕整理成可读性更好的段落。

本地离线安装步骤

不同平台的入口不同,普通用户建议直接用官方安装包,开发者可以走源码或 PyPI。

平台安装方式需要注意
macOS下载.dmg安装包支持 Intel 与 Apple Silicon
Windows下载安装程序程序未签名,安装时需选择「仍要运行」
LinuxFlatpak 或 Snap见下方命令
开发者 / 源码pip安装或克隆仓库需先装好 ffmpeg、使用 Python 3.12

Linux 下两条命令任选其一:

flatpak install flathub io.github.chidiwilliams.Buzz
sudo snap install buzz

源码方式适合需要最新功能的用户,克隆后安装运行:

git clone https://gitcode.com/GitHub_Trending/buz/buzz pip install buzz-captions python -m buzz

无网络环境下如何配置 Buzz 模型

Buzz 的离线前提是「模型已在本机」。若目标机器没有网络,可以在联网机器上先下载好模型,再整体拷贝到离线机器相同位置。模型缓存目录因系统而异:Linux 在~/.cache/Buzz,macOS 在~/Library/Caches/Buzz,Windows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache

在 Buzz 里也可从菜单打开 Preferences → Models,下载任意一个模型后点「Show file location」,会直接打开存放模型的文件夹,方便确认与拷贝。仓库中scripts/download-models.py脚本可用来预生成一批离线模型缓存,适合批量准备环境。

提示:*.En后缀的模型只识别英语,其他语言请使用不带后缀的模型;离线环境要提前把目标语言对应尺寸的模型都备好。

不同硬件下的模型选择

Buzz 内置多种 Whisper 后端,同一份音频可换不同后端与模型尺寸跑,速度、内存、准确率的取舍不同:

后端适合的硬件特点
Whisper(OpenAI 原版)内存充足准确但偏慢、占内存多
Faster WhisperNvidia 显卡,显存 ≥ 6GB速度最快、占用更低
Whisper.cpp任意显卡、核显或纯 CPU最省资源,Mac 与集显推荐
Hugging Face需自定义模型支持多语言及多种自定义 ASR 模型

模型尺寸从tinylarge:尺寸越小越快、越易出错;越大越准、越吃硬件。largelarge-v2large-v3turbo各有取向,官方文档给出的建议是「用自己语言的实际音频测一遍」再定。

按目标快速选:

  • 追求速度、硬件一般:whispercpp+base/small
  • 有 Nvidia 显卡、追求准确:fasterwhisper+medium/large
  • 需要特定语言或自定义模型:huggingface类型并指定模型 ID。

进阶能力与适用边界

  • 实时录音转录:从麦克风实时转写,可开启独立演示窗口用于现场;实时转录会持续占用算力,长时录音对硬件要求较高。
  • 文件夹监控:在 Preferences 的 Folder Watch 中指定目录,新放入的音频会自动进入转录队列,适合批量处理。
  • 说话人识别:可对转录结果区分不同发言人,会增加额外计算。
  • 降噪预处理:转录前可先做语音分离(extract-speech),适合背景嘈杂的录音。
  • 命令行buzz add支持--model-type--model-size--srt/--vtt--prompt--word-timestamps等参数,可写脚本批量处理,详见docs/docs/cli.md
  • 插件:内置 AI 摘要、自动字幕调整等插件,可在界面中启用。

常见限制与排查建议

  • CPU 太老:Buzz 要求 CPU 支持 AVX2,很老的机器无法运行,启动阶段可能直接报错。
  • 转得太慢:先换更小的模型或换 Whisper.cpp 后端;有 ≥6GB 显存的 Nvidia 显卡可换 Faster Whisper。
  • 麦克风报错(如 PaErrorCode-9999):多半是系统权限或安全软件拦截,检查系统麦克风权限并临时关闭可能干扰的程序。
  • 崩溃:常见原因是模型文件下载不完整,到 Preferences → Models 删除后重新下载;仍不行可在「About Buzz」里「Show logs」查看日志。
  • 实时模式卡:把「Append and correct」换成更省资源的「Append below」,或降低模型尺寸。

适合谁使用,什么情况下不建议使用

Buzz 适合:在本机处理录音与视频、需要导出字幕或纯文本、希望数据不上传云端的用户;尤其是字幕创作者、访谈/会议整理者、对隐私敏感的专业人士。

不太适合:期望「一键云端、秒出结果」且不愿在本地准备模型的用户;硬件过老(无 AVX2、内存不足)的机器;需要把大量识别任务卸载到远端、本地只负责展示的场景——这类需求可改用其 OpenAI API 后端,但那样就不再是纯离线。

下一步建议先做三件事确认是否匹配:确认本机 CPU 支持 AVX2;在目标语言下用tiny/base模型试跑一段真实音频,观察速度与准确率;确认需要导出的格式(TXT/SRT/VTT)和导出路径设置符合工作流。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询