Buzz 离线语音转文字完整指南:从一段录音到成品字幕只要 5 分钟
2026/9/14 11:29:30 网站建设 项目流程

Buzz 离线语音转文字完整指南:从一段录音到成品字幕只要 5 分钟

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

上周我手上有一段 40 分钟的访谈录音,想整理成文字稿,又怕上传给云端转写服务。折腾了一圈,最后用 Buzz 的离线语音转文字功能把音频直接在本地跑 Whisper 模型,转录、翻译、导出字幕一条线走完,全程没联网。如果你也在找一款不上传文件的语音转文字工具,这篇指南能帮你在 5 分钟内跑通第一份稿子。

它和云端转写工具差在哪

先说清 Buzz 的定位,你就明白它为什么适合敏感内容:

  • 全程离线:Whisper 模型装在你自己的电脑上,录音从导入到出稿不离开设备,会议纪要、客户访谈都放心
  • 零持续成本:装一次就能反复用,不按分钟计费,转多少个文件都不花钱
  • 后端可插拔:Whisper.cpp、Faster Whisper、Hugging Face 模型系列都能接,Nvidia 显卡走 CUDA、Mac 走 Apple Silicon、核显还能走 Vulkan(详见 安装说明)

安装 Buzz:按平台挑最短的路

Windows:从发布页下载安装包,双击安装。安装包未签名,首次运行会弹警告,选More info → Run anyway即可。

macOS:下载 .dmg 安装。注意现在只支持 Apple Silicon,Intel 机型的最后版本是 1.4.5。

Linux

sudo snap install buzz

习惯命令行:PyPI 方式装,要求 Python 3.12 并预装 ffmpeg:

pip install buzz-captions python -m buzz

第一次转录的三个步骤

装好打开就是主界面,别被这个朴素的样子骗了,它其实是一台完整的转录工作台:

主界面任务表格:每行一个文件,模型、任务类型、状态一目了然

首次转录就三步(参考 文件导入文档):

  1. 导入:菜单File → Import Media File,或按Ctrl/Command + O,音频、视频文件都行,也支持直接粘贴 YouTube 链接
  2. 选模型和任务:任务选Transcribe(原语言转文字)或Translate to English(翻译成英文)。模型尺寸上,Tiny/Base 出稿快适合打草稿,Small/Medium 是日常平衡点,Large 准确度最高,重要内容用它。顺手把语言手动指定一下,自动检测偶尔会翻车
  3. 点 Run:状态从 Queued 到 In Progress 再到 Completed,多文件可以批量排队跑。双击完成的那一行就进入查看器

模型管理页可以下载、切换不同 Whisper 模型

把转录结果校对并导出成字幕文件

转录完别急着走,双击任务进入查看器,这一步决定稿子能不能直接交付:

每段文字带起止时间,底部播放器支持变速,边听边改

  • 搜索定位:长录音找关键讨论点,搜索框直接跳过去
  • 播放校对:底部播放器配倍速,听到哪改到哪,改动自动保存
  • 一键导出:TXT、SRT、VTT 是主力格式,SRT/VTT 丢进剪辑软件就能当字幕用

我一般先整体听一遍抓大错,再用搜索逐条核对人名和公司名——这些最容易识别错,也可以在高级设置里用Initial prompt预填易错词来预防。

用 Resize 把字幕排成能交付的样子

转录工具都能"把话说对",但"字幕怎么排好看"是另一回事。Buzz 的Resize功能专门解决这个(文档见 编辑与 Resize):

Resize 面板:设定字幕最大长度,按标点、静音自动拆分合并

如果你导入时勾了Word-Level Timings(词级时间戳),Resize 就能按最大长度标点自动把碎词拼成整句字幕,音频还在本机时它还会分析静音段来修正边界;没勾词级时间戳也能按最大长度重新组合。另外可以整体延长每条字幕的显示时长,适合字幕偏快看不清的视频。做视频的朋友,这一步基本省掉手动切字幕的时间。

进阶玩法速览:从录音笔到自动化

实时录音转录:选麦克风和语言后点 Record,说话的同时出文字,还有独立的演示窗口方便投屏,访谈结束稿子就有了。

文件夹监控:在偏好里指定一个目录,之后丢进去的新音频自动转录,批量处理基本无人值守。

任意语言翻译:Whisper 自带"译成英文"之外,还能接任何 OpenAI 兼容 API 翻译成其他语言——包括本地跑的 Ollama、LM Studio,翻译也可以全程离线。

说话人识别:多人对话录音点Identify speakers,用 MSDD 模型给每段话标上说话人,还能试听 10 秒随机句子确认、把标签改成真实姓名,整理访谈纪要非常省时间。

CLI 脚本化:想要流水线就接命令行,比如buzz add meeting.mp3 -s small一条命令跑转录,用法细节在 CLI 文档 里。

五分钟跑起来

最低门槛的行动就一条命令,clone 下来跑起来:

git clone https://gitcode.com/GitHub_Trending/buz/buzz

找一段录音丢进去,你离第一份本地生成的字幕只差几分钟。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询