Buzz 离线转录工具:3 步从会议录音生成文字稿,免费且数据不出本机
2026/9/6 20:37:00 网站建设 项目流程

Buzz 离线转录工具:3 步从会议录音生成文字稿,免费且数据不出本机

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

高铁上断了网,而你手里有一份两小时的会议录音,明早就要交文字稿。这正是 Buzz 要解决的场景:一款离线语音转录工具,基于 OpenAI Whisper 在你的电脑上本地运行,音频和文稿数据不出本机,也没有任何 API 费用。

为什么选离线转录:Buzz 与云端语音服务的差异

云端转录服务按分钟计费、受文件大小和时长限制,且音频要上传到对方服务器。Buzz 把计算全部放在你的设备上,差异如下:

对比维度云端语音转录服务Buzz 本地离线转录
网络连接必须联网,弱网下任务中断模型下载后可完全离线运行
数据位置音频上传至服务商服务器始终留在本机磁盘
使用成本按调用量/时长计费软件免费,无 API 费用
文件限制常有大小、时长上限不限,可批量排队处理
语言支持取决于所选服务支持近百种语言转录与翻译

如果你需要转录的是敏感访谈、内部会议,或设备长期处于弱网环境,这个差异就是选择 Buzz 的理由。

安装 Buzz 并跑通第一次转录

普通用户:Windows 和 macOS 版本从 SourceForge 下载对应安装包即可。Windows 安装时会弹出未签名警告,点"更多信息"→"仍要运行"即可继续;macOS 双击.dmg拖入Applications完成。Linux 用户可用 Flatpak 或 Snap 一键安装。

开发者(需 Python 3.12 环境,并先装好 ffmpeg):

pip install buzz-captions python -m buzz

首次运行只需三步:

  1. 点击工具栏"+"号(或按 Ctrl/Cmd+O)导入一个音频或视频文件。
  2. 在表单里选择任务(转录或翻译成英语)、语言和 Whisper 模型参数。
  3. 点击"运行",等待状态变为"已完成",双击任务行打开转录视图。

转录视图里可以逐段播放、拖动进度、搜索文字,并直接导出为 TXT、SRT、VTT 三种格式。默认导出文件名支持模板变量(如输入文件名、日期),可在偏好设置中自定义,逻辑见 docs/docs/preferences.md。

按使用流程走一遍:导入、选模型、出稿到导出

导入音频。除本地文件外,Buzz 也支持导入视频文件和网络链接提取音轨,视频画面在转录视图中可同步播放。

选模型。这是影响速度和质量的最关键一步。Whisper 模型从 tiny 到 large 共五档,选错档位要么慢得等不住,要么错得没法用:

模型档位典型用途速度体验资源占用建议设备
tiny / base实时录音、快速预览极快普通笔记本
small日常会议、课程录音较快4 核以上 CPU
medium正式文稿、多语访谈一般独显或较新 CPU
large 系列重要存档、高难音频很高6GB 显存以上 GPU

官方 FAQ 还提示:large-v3 精度最高但偶尔会"脑补"不存在的词,turbo 档位则在速度和精度之间做了平衡。没有银弹,最稳妥的办法是拿同一段音频把几档都试一遍。

出稿与润色。勾选"Word-Level Timings"(按词生成时间戳)后,字幕可以按最大长度、标点位置重新合并,还能整体延长每条字幕的停留时间——这是做字幕时最实用的功能,对应工具在 buzz/widgets/transcription_viewer/transcription_resizer_widget.py。若音频环境嘈杂,开启"Extract speech"可先把人声分离出来再转录,准确率更稳;转录完成后还能用说话人识别区分不同发言者。

实时录音与演示窗口。选好任务、语言、麦克风后点"录音"即可边说边出文字,支持"追加并修正"等模式。开始录音后可打开演示窗口,把实时字幕投到大屏,适合演讲和无障碍场。

三个让批量转录更省事的效率玩法

  • 文件夹监听:在偏好设置的 Folder Watch 标签里添加一个目录,新放进来的音频文件会自动排队转录,输出格式和模型参数一次配好长期生效。
  • NVIDIA GPU 加速(仅 PyPI 安装版需要额外配置):安装带 CUDA 的 torch 后再启动,Buzz 会自动用 GPU 推理。
  • 命令行与快捷键buzz add命令支持指定模型、语言并直接输出 SRT/VTT,适合写脚本批量跑;常用快捷键如 Ctrl+O 导入,完整定义在 buzz/settings/shortcuts.py,偏好设置里还能改键。

三类人群最常用的打开方式

  • 研究者:访谈录音批量离线转录,符合数据伦理要求;导出 SRT 后可直接导入质性分析软件;多语言访谈靠语言参数逐个指定。
  • 视频创作者:从视频直接提取音频出字幕,用词级时间戳 + 时长调整工具精修每条字幕的出入点,按平台需求导出 SRT/VTT。
  • 会议与活动组织者:实时录音模式生成初步记录,演示窗口让参会者同步看到文字,会后在转录视图里修正错别字再导出纪要。

转录前就该纠正的三个认知

  1. 模型越大越好?不一定。large 档对硬件和时间都是重负载,日常会议用 small/medium 通常足够,实时录音建议 tiny/base 才跟得上语速。
  2. 语言靠自动检测就行?自动检测只依据开头几秒,方言、口音或混合语言场景容易判错。知道语言就明确选上,多数情况下准确率更高。
  3. 离线就一定用不了?只要模型下载完整就完全不需要网络。模型默认存在用户缓存目录(如 Linux 的~/.cache/Buzz),在有网机器上下载好、拷贝到离线机器的相同位置即可;仓库的scripts/download-models.py就是为这种场景准备的。

装好 Buzz、下载好你常用的那一档模型,把下一个待转录的文件丢进队列——离线文字稿这件事,本机就能闭环。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询