Buzz:离线语音转文字工具,5 分钟装完就能用
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
周五下午,手机里躺着一段 47 分钟的录音
周五下午五点,你刚结束 90 分钟的客户电话,手机里多了一段 47 分钟的录音,而对方晚上九点前要文字版。用云端语音转文字服务,得把这段敏感录音上传到别人的服务器;你更想要一个离线的方案,在自己的电脑上把录音转成文字。Buzz 就是干这个的。
Buzz 是什么:离线语音转文字
Buzz 是一款离线语音转文字工具,基于 Whisper(OpenAI 开源的语音识别模型),所有识别都在你自己的电脑上跑。和直接上传到云端相比,本质区别是:你的录音文件从头到尾没有离开过你的硬盘,断网也能转录。
它不只是"文件转文字":除了转写音频和视频文件,还支持翻译成英文、麦克风实时转录、给多人口播标记说话人,输出 TXT、SRT、VTT 三种格式。全程免费。
Buzz 安装步骤:三步跑起来
以 Windows 为例,这是最快的路径:
- 从官方发布页(Releases)下载 Windows 安装包
- 运行安装程序。应用未签名,系统弹出"未知发布者"提示时,点"更多信息"→"仍要运行"
- 打开 Buzz,点左上角"+"(或按 Ctrl+O)选择文件,选好音频语言和模型,点 Run
- 任务行状态变成 Completed 后,双击该行打开转录结果
第一次用要在选项里选一个模型,Buzz 会自动下载模型文件,最小的 tiny 模型只有几十 MB,笔记本就能跑。macOS 下载 .dmg 拖进应用程序文件夹即可,Linux 用 flatpak 一条命令装好。习惯 Python 的开发者也可以直接装:
pip install buzz-captions python -m buzz装完就能用。
Buzz 实时转录、说话人识别与字幕合并 🎙
Buzz 实时录音转录怎么用
它能做什么:选好麦克风点 Record,屏幕上就随你的说话实时长出文字。有三种模式——新句子追加在底部、顶部,或者"追加并纠正"(会回头修正上一句末尾的错认)。还配一个展示窗口,大字显示转录结果。
具体怎么操作:在 Live recording 界面选麦克风、语言和模型,点 Record。实时场景建议选 tiny 或 base 这类小模型,才能跟上说话速度;文档明确建议用 Whisper.cpp 后端,它在核显甚至纯 CPU 的笔记本上也能实时跑。
什么时候会用到:演讲和播客直播出字、会议实时上字幕、访谈时边聊边出初稿。
Buzz 说话人识别怎么用
它能做什么:文件转录完成后,自动把不同声音聚类,每句话打上 Speaker 1、Speaker 2 之类的标签,可以改成真名,还能试听某位说话人 10 秒的随机语句来确认身份。
具体怎么操作:双击任务行进入转录查看器,点"Identify speakers"按钮,核对标签后保存;勾选"合并说话人句子"后,同一人连续说的话会并成一段。
什么时候会用到:双人或多人的访谈、客户电话、会议,凡是需要区分"谁说了什么"的场合。
Buzz 字幕太长怎么自动合并
它能做什么:默认转录的分段经常长到一行放不下,Resize 功能可以把带词级时间戳的转录重新切成字幕长度的块——按静音间隙合并、按标点分割,并限制单条字幕最大长度;如果原始音频还在,它会分析音频里的静音来校准时间轴。
具体怎么操作:导入文件时在选项里勾选 Word-Level Timings,转录完成后点查看器里的"Resize",设好最大长度,直接导出 SRT 或 VTT。
什么时候会用到:给视频做字幕,导出后可以直接拖进剪辑软件。
Buzz 批量转录:从 3 段录音到字幕文件的一天
说一个播客编辑的完整一天。
早上九点,他收到 3 段采访录音。他把文件夹设为 Buzz 的监视目录——文件夹监视功能会在检测到新音频文件落盘时自动开始转录,结果按设定保存到输出位置。三个任务在队列里并行跑,他去做了杯咖啡。
十点,第一段转完。这段是双人对谈,他打开查看器跑了一次说话人识别,把标签改成"主播"和"嘉宾",导出 TXT 给文案同学改稿。
另外两段要剪成视频,导入时他勾了 Word-Level Timings,转完用字幕合并把单条长度压到 18 字以内,导出 SRT,直接丢进剪辑软件。
中午,3 段录音变成 1 份文字稿加 2 份字幕文件,全程录音没有离开过他的电脑。
Buzz 常见问题:转录慢、错字多、没网
转录跑了 20 分钟才出一半
症状:47 分钟的音频,跑了半小时还没完。 原因:模型选大了,或者纯 CPU 在硬扛,没用到 GPU 加速。 解决:模型类型换成 Whisper.cpp(C++ 实现,Nvidia、核显、纯 CPU 都能用)配更小的模型;有 6GB 以上显存的 Nvidia 显卡可以直接用 Faster Whisper,速度快一个量级。
识别结果里专有名词全是错别字
症状:产品名、人名被转成形近的词。 原因:模型对没见过的词只能"猜",自动检测语言也可能带偏。 解决:导入选项里点"Advanced…",在 Initial prompt(初始提示)里把容易错的词写进去;语言手动选准,别依赖自动检测。
完全断网的电脑也能用 Buzz 吗
症状:目标电脑没有网络,而模型首次要用时要下载。 解决:在有网的电脑上打开 帮助 → Preferences → Models,把要用的模型下好,点"显示文件位置"打开模型目录,整个拷到离线电脑相同位置(Linux 在家目录的 .cache/Buzz 下),Buzz 照常离线工作。
谁适合用 Buzz,下一步做什么
录音内容敏感、经常离线工作、或要批量处理音频的人,Buzz 能帮你省下上传和等待的麻烦;只是偶尔转一段公开视频,云端服务更省事。
下一步:去官方发布页拉一个对应系统的安装包,把你的第一段录音丢进去试试。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考