5 分钟上手 Buzz 离线音频转录:本地 Whisper 转录完整教程
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
把一段长录音转成文字,多数工具要求你先把文件传到云端:录音离开你的电脑,按分钟计费,断网就用不了。Buzz 把这几点一次绕开——它是一款基于 OpenAI Whisper(一个开源语音识别模型)的离线音频转录桌面工具。你把录音丢进任务列表,它就在本地完成识别、打时间戳、导出字幕,全程不联网,音频不离开磁盘。
Buzz 项目定位:本地、离线、后端可换
Buzz 是一个跨平台的桌面端语音识别应用(Windows、macOS、Linux 都有),音频解码、模型推理、结果保存全在你自己的电脑上完成,适合"数据不出机器"的需求。对很多人来说,它就是能直接上手的音频转字幕工具。
它不绑死在某一个引擎上,内置了多种 Whisper 后端:原生 Whisper、用 C++ 重写、依赖更轻的 Whisper.cpp,以及 GPU 上跑得更快的 Faster Whisper,按你的硬件在设置里切换就行。典型用户大致三类:
- 播客和视频创作者:录音转字幕,SRT 直接导出
- 会议和访谈记录者:实时转录,还能区分说话人
- 多语言研究者:支持约 99 种语言,还能把外语音频译成中文文本
Buzz 主界面:文件在列表里排队,每项显示模型、任务类型和进度
🚀 Buzz 安装步骤:从下载到第一次转录
- 选获取方式:Mac 和 Windows 下官方安装器,Linux 用 Flatpak 或 Snap 包;开发者也可以走 PyPI,命令是
pip install buzz-captions。 - 走 Python 路线需要 3.12 环境,并装好 FFmpeg(Buzz 靠它解码音视频文件)。
- 启动:双击安装器,或在命令行运行
python -m buzz。 - 首次启动进"设置 → 模型":挑一个模型类型(Whisper、Whisper.cpp 等)和模型大小。
- 设定音频语言,留空则自动检测。
- 按硬件配加速器:N 卡装 CUDA,核显选 Whisper.cpp 的 Vulkan,Mac 无需额外设置。
做完这几步,主界面就是任务列表,可以开始干活了。
设置的 Models 页:在这里选后端、模型大小和加速器
一次完整的离线语音转文字流程
Buzz 把离线音频转录做成了队列任务,主线四步:
- 导入音频:拖文件进窗口,或点顶部工具栏的加号,YouTube 链接也能加。
- 设置任务:给每个任务配模型和类型(转录或翻译)。
- 开始转录:列表实时显示进度,多个文件排队依次处理。
- 查看与导出:双击完成的任务,打开转录查看器。
查看器里每段文字带开始、结束时间戳,点击段落音频就跳到对应位置,搜索、播放、调速一应俱全。导出支持 TXT、SRT、VTT 三种格式,做字幕的人可以直接丢进剪辑软件。
除了文件,还有三个功能值得试:
- 🎙️实时转录:点麦克风按钮边录边转,按间隔缓冲,兼顾速度和准确率;还有专门的演示窗口,适合活动现场出字幕
- 说话人区分:多人对话自动标注谁在说话,提前告诉它有几位说话人会更准
- 段落合并:字幕切得太碎时,在 Resize 菜单里一键合并成合适长度
转录查看器:每行文字对应一个时间区间,点击定位、直接播放
Whisper 模型怎么选:Tiny 到 Large
| 模型 | 速度 | 精度 | 适合干什么 |
|---|---|---|---|
| Tiny | 最快 | 最低 | 实时字幕、快速校对、配置有限的电脑 |
| Base | 快 | 够用 | 日常对话、大批量初筛 |
| Medium | 中等 | 较高 | 学术材料、专业术语、要求准确的内容 |
| Large | 最慢 | 最高 | 法律、医疗等对质量要求高的场景 |
拿不准就从 Medium 起步,看结果再往上调或往下调。模型越大耗时越长,同一个文件用 Large 可能是 Tiny 的数倍,离线音频转录的等待成本主要就花在这一步。
⚡ 硬件加速配置与常见排坑
三种加速器各有受众:
- CUDA:NVIDIA 显卡用,1.4.6 起需单独安装,检测到显卡会弹提示,也可以从帮助 → 关于 Buzz 里手动装
- Vulkan:通过 Whisper.cpp 实现,覆盖大多数现代显卡,包括集成显卡
- Apple Silicon:Mac 的 M 系列芯片是一等公民,开箱即用
高频问题和一句话解法:
- 转录太慢:模型选大了或加速器没生效——换小一号模型,或检查加速器配置
- 内存占用高:长音频对内存压力大——把文件切开,或用小模型分段处理
- 多语言识别错:语言留空时自动检测会抽风——转录前手动指定语言
- 嘈杂录音识别乱:背景音乐和噪音干扰识别——开启"先提取人声"预处理
- Windows 安装时提示未签名:正常现象——点"更多信息"再选"仍要运行"
和云端转录服务,差在哪
| 维度 | 云端转录服务 | Buzz 本地处理 |
|---|---|---|
| 隐私 | 音频要上传,存在服务商那边 | 文件不出电脑,全程离线 |
| 成本 | 按时长计费或订阅 | 装一次,没有持续费用 |
| 网络 | 依赖连接,断网停摆 | 完全离线可跑 |
| 定制 | 功能由服务商定,列表固定 | 开源,可换后端、装插件、换模型 |
| 速度体验 | 受上传带宽和服务器负载影响 | 只取决于你的硬件,可预期 |
对多数人,第一行才是决定性理由:有些录音,就是不能传上云。
🔧 进阶玩法:批处理与扩展
Buzz 也能当自动化管道里的一环:命令行可以完成界面里所有操作——添加任务、指定模型、导出 SRT,细节见 CLI 文档。配合文件夹监听,把新文件丢进目录就会自动转录,不用手动点。想扩展就找插件系统,AI 摘要、自动字幕合并这类社区插件直接安装;照着源码里对应接口写,还能接新的模型后端或输出格式。部署细节可以看 安装文档 和 中文 README。
Buzz 代表的方向很清楚:把 AI 能力搬回自己的电脑,把数据主权还给你。如果你经常要转音频、又不想让文件出机器,这款离线音频转录工具现在就能用——装好包、选好模型,直接开工。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考