Buzz 离线语音转文字完整指南:5 步把音频变成可编辑字幕
2026/9/7 6:04:56 网站建设 项目流程

Buzz 离线语音转文字完整指南:5 步把音频变成可编辑字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款在你个人电脑上运行的离线语音转文字工具。它基于 OpenAI 的 Whisper 模型,把音频、视频本地转录和翻译成文字,全程不上传、不限时长。适合整理会议录音、给视频配字幕、做实时听写的新手和普通用户。

快速了解:Buzz 是什么

Buzz 解决一个很具体的问题:把"只能听"的录音变成"能搜索、能编辑"的文字,同时数据不出你的电脑。所有计算在本地完成,支持 99 种语言,纯 CPU 可运行,NVIDIA 显卡可开 CUDA 加速,Mac 的 Apple Silicon 也有专门支持。

卖点说明
完全离线转录在本地执行,无上传、无排队,断网也能用
开源免费MIT 协议,源码可查
不限时长2 小时录音照样转,无云端计费
双入口图形界面处理单文件和实时录音,命令行处理批量任务
多后端Whisper、Whisper.cpp、Faster Whisper、HuggingFace 可选,适配不同硬件

快速开始:从安装到第一条转录

第 1 步:按平台安装 Buzz。

系统方式命令或操作
macOS下载.dmg安装包从项目发布渠道下载后打开
Windows下载安装包见下方注意
LinuxFlatpak 或 Snapflatpak install flathub io.github.chidiwilliams.Buzzsudo snap install buzz
任意系统PyPI 源码式安装pip install buzz-captions,再运行python -m buzz

注意(Windows 用户必看):Buzz 安装包未做代码签名,安装时系统会弹出警告,选"更多信息"→"仍要运行"即可继续。

第 2 步:导入文件。点击菜单"文件 → 导入媒体文件"(快捷键Ctrl/Cmd + O),或点工具栏的"+"图标,选中音频或视频文件。

第 3 步:设置三个参数。在弹窗里选择Task(Transcribe 或 Translate to English)、Language(建议手动指定,如zh)、Model(新手选basesmall)。

第 4 步:点击"Run"。任务进入队列,主界面显示实时进度。

第 5 步:打开结果。状态变为"Completed"后,双击任务行进入转录查看器,你的第一条转录稿就完成了。

核心功能详解

文件转录与导出

它做什么:把音频、视频甚至 YouTube 链接转成带时间戳的文字,并导出为 TXT、SRT、VTT、JSON 等格式。

怎么做:

  1. 导入文件时,在Export AsSRTVTT,转录完成自动落盘;
  2. 需要精细排版时,点查看器工具栏的"导出"按钮手动选格式;
  3. 在偏好设置的"默认导出文件名"里设好模板,例如{{ input_file_name }} ({{ task }}d on {{ date_time }}),之后自动套用。

提示:勾选Word-Level Timings(词级时间戳),后续才能用"Resize"做更智能的字幕重组,做字幕建议转录前就勾上。

模型选择:速度与精度对照

它做什么:决定转录的准确率、耗时和内存占用。模型从tinybasesmallmediumlarge逐级提升,另有Large-V2Large-V3Turbo等变体。

怎么做:

  1. 打开"帮助 → 偏好设置 → Models";
  2. 在待下载清单里勾选模型,点"Download",也可以选Custom粘贴自定义模型的下载地址;
  3. 没有 NVIDIA 显卡就选 Whisper.cpp 后端,它支持任意品牌的 GPU 和纯 CPU,还能选q_5这类量化版本省内存。

提示:tiny/base给实时录音用,small是日常甜点,large留给专业录音且建议配 GPU。

实时录音转录

它做什么:对着麦克风说话,文字逐句生成,适合会议速记、演讲同传、直播字幕。

怎么做:

  1. 切到"Live Recording"标签页,选麦克风、语言和模型;
  2. 点红色"Record"按钮开始;
  3. 需要投屏时打开演示窗口(Presentation Window),把实时字幕显示在另一块屏上。

注意:实时转录对性能要求高,务必用 Whisper.cpp 后端加tinysmall模型,否则文字跟不上语速。

转录查看器:编辑与字幕调整

它做什么:查看、校对、搜索转录稿,并微调每段字幕的时间戳。查看器提供时间戳、纯文本、翻译三种视图,支持Ctrl/Cmd + F搜索、Ctrl/Cmd + P播放、Ctrl/Cmd + ←/→以 0.5 秒为单位微调片段起止时间。

怎么做:

  1. 双击任务行打开查看器,直接在表格里改文字,改动自动保存;
  2. 点"Resize"按钮,按最大字幕长度、标点分割等规则重新断句;
  3. 开启"Follow Audio"后,文字会跟随播放进度自动滚动,方便校对长音频。

提示:原音频文件还在本机时,Resize 会额外分析静音间隙,断句更准。

任意语言 AI 翻译

它做什么:Whisper 自带"任意语言 → 英文"的离线翻译(TaskTranslate to English即可)。要翻到其他语言(如英语 → 西班牙语),接一个 OpenAI 兼容 API 就能实现。

怎么做:

  1. 在偏好设置里填 API 的 Base URL 和 Key,本地跑 Ollama、LM Studio 也可以接;
  2. 打开已有转录,点查看器工具栏的"Translate"按钮;
  3. 在"Instructions for AI"里写清指令,例如"只翻译成西班牙语,不加注释"。

提示:约 1 小时音频用云端模型翻译成本在 1 美元量级;追求全离线就把翻译模型也跑在本地。

命令行与文件夹监控

它做什么:用buzz add批量下发转录任务,配合监听文件夹实现"丢进去就自动转"。

怎么做:

  1. 终端输入buzz add --help查看全部参数;
  2. 一次传入多个文件,指定模型和输出格式;
  3. 在偏好设置里开启文件夹监控(Folder Watch),新文件自动进队列。

提示:1.4.5 版本起的插件系统提供了"Skip Already Transcribed",重复导入同一批文件时自动跳过已有结果的,批量任务不怕误操作。

实战配方

配方一:批量生成 SRT/VTT 字幕buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 访谈.mp3 会议.wav,两个文件转完直接产出字幕文件。

配方二:降低错字率→ 转录时在Advanced...里填Initial prompt,把常见人名、产品名写进去;命令行则加--prompt "产品名是 X,人名是 Y"

配方三:系统声音转文字→ macOS 用brew install blackhole-2ch装 BlackHole 并建多输出设备;Windows 装 VB-CABLE 后把输出选为"CABLE Input";Linux 用pavucontrol重定向应用音频。然后在 Buzz 里把麦克风选为该虚拟设备,录制的就是系统外放的声音。

常见问题

问:模型文件存在哪里? 答:Linux 在~/.cache/Buzz,macOS 在~/Library/Caches/Buzz,Windows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。也可在"帮助 → 偏好设置 → Models"下载后点"Show file location"直接打开文件夹。

问:转录太慢怎么办? 答:换更小的模型,或改用 Whisper.cpp 后端;NVIDIA 显卡显存至少 6GB 的话,选 Faster Whisper 会快一个量级。

问:完全没有网络的电脑能用吗? 答:能。先在联网电脑上下载好模型,把模型文件夹复制到离线机器的同一位置(参考 FAQ 中的路径),再用scripts/download-models.py脚本可提前准备整套模型缓存。

问:GPU 加速没生效? 答:确认 NVIDIA 驱动和 CUDA 12 装好;Windows 版安装包自带 GPU 支持,旧 CUDA 会自动回退 CPU。想强制纯 CPU 可设环境变量BUZZ_FORCE_CPU=true

问:自动检测语言经常判错? 答:官方建议只要知道语言就手动指定,这能显著提升准确率;也可以在插件里启用"Enhanced Language Detection",用本地模型在转录前先做一轮检测。

问:Buzz 启动崩溃是什么情况? 答:多是模型下载不完整,到"帮助 → 偏好设置 → Models"删除后重新下载。另注意 Buzz 需要 CPU 支持 AVX2,过老的机器跑不起来。

下一步

Buzz 把"离线语音转文字"做成了装完就能用的本地工具:导入、转录、编辑、导出,一条流水线全在电脑上完成。现在就装一个 Buzz,导入你手头最需要整理的那段录音,点一下"Run"。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询