Buzz 离线转录工具:3 步从会议录音生成文字稿,免费且数据不出本机
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
高铁上断了网,而你手里有一份两小时的会议录音,明早就要交文字稿。这正是 Buzz 要解决的场景:一款离线语音转录工具,基于 OpenAI Whisper 在你的电脑上本地运行,音频和文稿数据不出本机,也没有任何 API 费用。
为什么选离线转录:Buzz 与云端语音服务的差异
云端转录服务按分钟计费、受文件大小和时长限制,且音频要上传到对方服务器。Buzz 把计算全部放在你的设备上,差异如下:
| 对比维度 | 云端语音转录服务 | Buzz 本地离线转录 |
|---|---|---|
| 网络连接 | 必须联网,弱网下任务中断 | 模型下载后可完全离线运行 |
| 数据位置 | 音频上传至服务商服务器 | 始终留在本机磁盘 |
| 使用成本 | 按调用量/时长计费 | 软件免费,无 API 费用 |
| 文件限制 | 常有大小、时长上限 | 不限,可批量排队处理 |
| 语言支持 | 取决于所选服务 | 支持近百种语言转录与翻译 |
如果你需要转录的是敏感访谈、内部会议,或设备长期处于弱网环境,这个差异就是选择 Buzz 的理由。
安装 Buzz 并跑通第一次转录
普通用户:Windows 和 macOS 版本从 SourceForge 下载对应安装包即可。Windows 安装时会弹出未签名警告,点"更多信息"→"仍要运行"即可继续;macOS 双击.dmg拖入Applications完成。Linux 用户可用 Flatpak 或 Snap 一键安装。
开发者(需 Python 3.12 环境,并先装好 ffmpeg):
pip install buzz-captions python -m buzz首次运行只需三步:
- 点击工具栏"+"号(或按 Ctrl/Cmd+O)导入一个音频或视频文件。
- 在表单里选择任务(转录或翻译成英语)、语言和 Whisper 模型参数。
- 点击"运行",等待状态变为"已完成",双击任务行打开转录视图。
转录视图里可以逐段播放、拖动进度、搜索文字,并直接导出为 TXT、SRT、VTT 三种格式。默认导出文件名支持模板变量(如输入文件名、日期),可在偏好设置中自定义,逻辑见 docs/docs/preferences.md。
按使用流程走一遍:导入、选模型、出稿到导出
导入音频。除本地文件外,Buzz 也支持导入视频文件和网络链接提取音轨,视频画面在转录视图中可同步播放。
选模型。这是影响速度和质量的最关键一步。Whisper 模型从 tiny 到 large 共五档,选错档位要么慢得等不住,要么错得没法用:
| 模型档位 | 典型用途 | 速度体验 | 资源占用 | 建议设备 |
|---|---|---|---|---|
| tiny / base | 实时录音、快速预览 | 极快 | 低 | 普通笔记本 |
| small | 日常会议、课程录音 | 较快 | 中 | 4 核以上 CPU |
| medium | 正式文稿、多语访谈 | 一般 | 高 | 独显或较新 CPU |
| large 系列 | 重要存档、高难音频 | 慢 | 很高 | 6GB 显存以上 GPU |
官方 FAQ 还提示:large-v3 精度最高但偶尔会"脑补"不存在的词,turbo 档位则在速度和精度之间做了平衡。没有银弹,最稳妥的办法是拿同一段音频把几档都试一遍。
出稿与润色。勾选"Word-Level Timings"(按词生成时间戳)后,字幕可以按最大长度、标点位置重新合并,还能整体延长每条字幕的停留时间——这是做字幕时最实用的功能,对应工具在 buzz/widgets/transcription_viewer/transcription_resizer_widget.py。若音频环境嘈杂,开启"Extract speech"可先把人声分离出来再转录,准确率更稳;转录完成后还能用说话人识别区分不同发言者。
实时录音与演示窗口。选好任务、语言、麦克风后点"录音"即可边说边出文字,支持"追加并修正"等模式。开始录音后可打开演示窗口,把实时字幕投到大屏,适合演讲和无障碍场。
三个让批量转录更省事的效率玩法
- 文件夹监听:在偏好设置的 Folder Watch 标签里添加一个目录,新放进来的音频文件会自动排队转录,输出格式和模型参数一次配好长期生效。
- NVIDIA GPU 加速(仅 PyPI 安装版需要额外配置):安装带 CUDA 的 torch 后再启动,Buzz 会自动用 GPU 推理。
- 命令行与快捷键:
buzz add命令支持指定模型、语言并直接输出 SRT/VTT,适合写脚本批量跑;常用快捷键如 Ctrl+O 导入,完整定义在 buzz/settings/shortcuts.py,偏好设置里还能改键。
三类人群最常用的打开方式
- 研究者:访谈录音批量离线转录,符合数据伦理要求;导出 SRT 后可直接导入质性分析软件;多语言访谈靠语言参数逐个指定。
- 视频创作者:从视频直接提取音频出字幕,用词级时间戳 + 时长调整工具精修每条字幕的出入点,按平台需求导出 SRT/VTT。
- 会议与活动组织者:实时录音模式生成初步记录,演示窗口让参会者同步看到文字,会后在转录视图里修正错别字再导出纪要。
转录前就该纠正的三个认知
- 模型越大越好?不一定。large 档对硬件和时间都是重负载,日常会议用 small/medium 通常足够,实时录音建议 tiny/base 才跟得上语速。
- 语言靠自动检测就行?自动检测只依据开头几秒,方言、口音或混合语言场景容易判错。知道语言就明确选上,多数情况下准确率更高。
- 离线就一定用不了?只要模型下载完整就完全不需要网络。模型默认存在用户缓存目录(如 Linux 的
~/.cache/Buzz),在有网机器上下载好、拷贝到离线机器的相同位置即可;仓库的scripts/download-models.py就是为这种场景准备的。
装好 Buzz、下载好你常用的那一档模型,把下一个待转录的文件丢进队列——离线文字稿这件事,本机就能闭环。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考