Buzz 语音转写实战:本地离线把任意音频变成 SRT 字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款本地语音转文字工具:基于 OpenAI Whisper,在你的电脑上全程离线转写、翻译音频和视频,支持导出 TXT / SRT / VTT。读完这篇指南,你能按系统装好它,并产出第一份带时间轴的字幕文件。
📦 交付物速览:你会拿到什么
装好 Buzz 后,你实际产出的是这几样东西:
- 三种格式的文字稿:TXT(纯文本笔记)、SRT / VTT(带时间轴的字幕),在转录详情页右上角一键导出,详见 转录查看器说明
- 带时间轴的分段文本:每段都有起止时间,点任意一行,播放器立刻跳到对应音频位置,方便边听边校对
- 三种输入来源:本地音频/视频文件、在线视频链接、麦克风实时录音
- 翻译能力:Whisper 内置"转写+翻译成英文";配置 AI 接口后可翻译成中文等任意语言,见 翻译指南
- 噪音应对:开启"提取语音"(基于 Demucs 声分离)可先把人声从背景里剥离,嘈杂录音识别更干净
- 自动批处理:文件夹监控模式会接住新丢进来的文件自动排队转写
边界也说清楚:音频不上传、不按分钟计费;首次使用某个模型时需联网下载一次,之后离线可用。
🖥️ 环境就绪:四种安装方式按系统选
- Windows:下载官方发布页的安装包双击安装。应用未签名,弹出安全警告时点「更多信息」→「仍要运行」。
- macOS:下载
.dmg拖入「应用程序」。注意 Buzz 现仅支持 Apple Silicon,Intel Mac 最后可用版本是 1.4.5。 - Linux(Snap):
sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module && sudo snap install buzz,再sudo snap connect buzz:password-manager-service授权密码存储;也可用 Flatpak:flatpak install flathub io.github.chidiwilliams.Buzz。 - Python 环境:先装好 ffmpeg,再用 Python 3.12 执行
pip install buzz-captions,启动命令是python -m buzz。
NVIDIA 显卡用户:1.4.6 起 CUDA 加速需单独装,进Help → About Buzz → Install CUDA Acceleration即可,无需手动配环境。更多细节见 安装文档。
🚀 首次跑通:从导入到导出的五步
- 导入文件:
Ctrl/Cmd + O或点工具栏「+」,选择 MP3 / MP4 等音视频文件(详见 文件导入文档)。 - 选参数:在任务行里挑模型档位(首次建议 tiny 或 base,下载快)、任务类型(转写)、语言(不确定就自动检测)。
- 点 Run:如果模型不在本地,会自动开始下载——最常见的卡点就在这里,下载慢或被中断都会让任务停在队列里。
- 状态变 Completed 后双击该行,打开转录详情。
- 右上角菜单选 TXT / SRT / VTT 导出,文件默认存到输入文件所在目录。
第一次建议用一小段音频跑通全流程,别一上来就丢两小时的录音。
⚙️ 核心流程与参数速查
主路径四步:导入 → 选参数 → 校对 → 导出。队列里每项都显示文件、模型、任务类型与实时进度,关掉窗口任务仍在后台继续。
校对阶段,双击已完成任务进入转录详情:点任意段落到音频对应位置,直接改文字即可,改动自动保存。字幕行太长时,用「Resize」按钮按最大长度自动拆分或合并,详见 编辑与调整指南。
| 参数 | 常见取值 | 作用 |
|---|---|---|
| 模型档位 | tiny / base / small / medium / large | 速度 ↔ 准确率平衡点 |
| Whisper 类型 | whisper / whisper.cpp / faster-whisper / huggingface | 不同后端:whisper.cpp 通吃 CPU 与各种 GPU,faster-whisper 适合 6GB 显存以上的 NVIDIA |
| 任务 | 转写 / 翻译 | 翻译 = 转写 + 翻译成英文一步完成 |
| 语言 | 手动指定或自动检测 | 短音频、混合语言建议手动指定更稳 |
| 词级时间轴 | 开 / 关 | 开启后每词一行,便于后续精细合并字幕 |
| 初始提示词 | 常见专有名词 | 在「高级」里填写,减少人名术语拼错 |
| 提取语音 | 开 / 关 | 嘈杂环境先分离人声再转写 |
| 输出格式 | TXT / SRT / VTT | 字幕用 SRT,纯笔记用 TXT |
🎬 场景演练:三个高频用法
如果你要把两小时采访录音变成可用文字稿,这样做:
- 录音拖进队列,模型选 small 或 medium(有 NVIDIA 显卡就开 CUDA,速度快数倍)
- 等状态变 Completed,双击打开详情
- 边播放边校对人名、术语;拿不准的词以后可以填进「初始提示词」
- 导出 TXT 发出去,收工
如果你要给英文视频做中文字幕,这样做:
- 拖入视频,任务类型选 Translate,先用 Whisper 转写并翻译成英文
- 在转录详情页点「Translate」,配置 AI 接口后指定目标语言为中文(见 翻译指南)
- 导出 SRT,预览发现某行太长
- 打开 Resize,设好目标长度:长句按标点自动拆、碎片自动合并
如果你想让团队共享的录音自动转写,这样做:
- 在 Preferences 里开启文件夹监控,指向共享目录(设置项见 偏好设置文档)
- 同事丢文件进来,Buzz 自动排队处理,转写结果落在输出目录
- 想跳过已有文稿的文件,启用 skip already transcribed 插件
🚀 性能与进阶:关键开关怎么拨
- 模型档位→ 决定速度与准确率的平衡 → 日常笔记用 base、快速试听用 tiny、交付级字幕上 large-v3。
- Whisper 类型→ 决定跑在哪个后端 → 没有 NVIDIA 卡选 whisper.cpp(可吃任意 GPU 甚至纯 CPU);显存 ≥ 6GB 的 NVIDIA 选 faster-whisper 提速明显。
- CUDA 加速→ 1.4.6 起单独安装 → 装好后 large 模型转写提速数倍;没有 NVIDIA 卡就不用管。
- 提取语音(声分离)→ 先剥离背景音再转写 → 会议室、街头等嘈杂录音开,干净录音不开以免浪费算力。
- 输出目录与文件名模板→ 在 Preferences 里一次配好
{{ input_file_name }}等变量 → 批量导出位置命名统一,文稿不散落。 - 离线机器→ 在有网电脑下好模型,把缓存目录拷到离线机同位置(Linux 为
~/.cache/Buzz)→ 或用 scripts/download-models.py 预准备模型。
命令行党可以直接用 CLI 批量跑,例如对一整文件夹出 SRT:buzz add --srt --output-directory ./subtitles recordings/*.mp4,全部选项见 CLI 文档。
🔍 排错对照:常见卡点与动作
- 转写比预期慢?→ 先降一档模型 → 换 whisper.cpp 后端 → 有 NVIDIA 卡装 CUDA → 别并行跑多个大任务。
- 任务一直排队不动?→ 多半是模型没下完,回 Models 页确认模型就位后重新排队。
- 识别错漏太多?→ 换 large 模型重跑;专有名词写进「初始提示词」;录音嘈杂先开「提取语音」。
- 自动检测语言不准?→ 手动指定语言代码,短音频和混合语言尤其必要。
- 超大文件内存吃紧?→ 降一档模型或先切段分批处理;显存紧张可开启 GPU 显存压缩选项。
- 录音报错(PaErrorCode-9999)?→ 检查系统隐私设置里 Buzz 的麦克风权限,或被安全软件拦截。
- Buzz 崩溃?→ 模型可能下载损坏,在 Models 页删除后重新下载;老 CPU 注意 Buzz 需要 AVX2 指令集。
- 完全离线的电脑怎么用?→ 拷贝模型缓存目录即可,模型位置见 FAQ。
写在最后
Buzz 把整套 Whisper 转写工作站装进你的电脑:不上传、不计费,从丢进文件到导出字幕全程离线。挑一种装法装好,把第一段音频拖进去,文字稿和字幕就都有了。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考