Buzz 本地语音转文字:45 分钟录音离线转录,5 分钟跑通全流程
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
刚结束一场访谈,录音笔里躺着一段 45 分钟的对话,需要转成文字。上传给在线服务的话,谈话内容得先经过别人家的服务器。Buzz 就是为这种场景做的:离线音频转录全部跑在你自己的电脑上,由 Whisper 模型驱动,音频文件不出设备,转完还能直接导出 SRT 字幕。
Buzz 能做什么
一句话定位:Buzz 是一个桌面应用,用 Whisper 在本地把音频、视频转成文字和字幕,然后交给你在界面上编辑导出。
| 功能 | 一句话说明 | 典型用途 |
|---|---|---|
| 离线转录 | 本地 Whisper 模型处理 MP3、WAV、M4A、MP4 等文件 | 会议录音、访谈素材 |
| 批量处理 | 多个文件排队依次转录,进度实时可见 | 播客、课程系列批量归档 |
| 实时录音 | 麦克风边录边转,文本随说话显示 | 现场会议、课堂笔记 |
| 字幕编辑与导出 | 逐段改时间轴和文字,导出 SRT / VTT / TXT | 给视频补字幕 |
| 多语言识别 | 支持 99 种以上语言,可指定语言或自动检测 | 外语材料、多语种内容 |
整条链路从读取音频到生成文本都在本机完成,敏感录音不用担心被上传。
Buzz 安装步骤:5 分钟跑起来
按平台选一种方式,命令都合在下面一个代码块里。
- Windows:从发行版页面下载安装包,双击安装;程序未签名,遇到警告点"更多信息"→"仍要运行"。
- macOS:下载 .dmg,拖进应用程序,首次启动允许打开即可(Intel 和 Apple silicon 都支持)。
- Linux:推荐 Snap 版,先装 portaudio 等依赖;也可以走 Flatpak。
- Python:需要系统里已有 ffmpeg,装完包直接用模块方式启动。
# Windows:下载安装包后双击安装(未签名,弹窗选"更多信息" → "仍要运行") # macOS:下载 .dmg 拖入应用程序文件夹 # Linux(Snap) sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz sudo snap connect buzz:password-manager-service # Linux(Flatpak 备选) flatpak install flathub io.github.chidiwilliams.Buzz # Python(跨平台,需先装好 ffmpeg) pip install buzz-captions python -m buzz第一次转录只有 3 步:
- 点主界面左上角的 "+" 或按 Ctrl+O,选中音频文件
- 在任务行里选好模型,语言可以先留自动检测
- 点该行右侧的播放按钮开始,文本会实时出现在列表里
第一次选择模型时会自动下载到本地缓存目录~/.cache/Buzz/models/,建议在网络稳定的时候先跑一次。
Buzz 主界面:导入的文件排在任务列表里,每行可单独控制模型、语言和进度
Buzz 功能拆解:从转录到字幕
基础转录:单个文件出文本
最核心的链路——把文件丢进去,拿回全文和字幕文件。
- 导入文件,在任务行设置模型、语言和输出格式(TXT / SRT / VTT)
- 点播放开始,进度按段落推进,可以边跑边看文字
- 完成后用导出菜单选择格式和保存位置
实用技巧:语言框除了自动检测,也可以手动指定语种;"初始提示"(Initial prompt)里写上人名、产品名这类背景词,专有名词的识别会明显更稳。
批量队列:一次丢多个文件
文件多就排队,让队列自己按顺序跑完。
- 选择文件时按住 Ctrl(macOS 用 Cmd)多选,一次性入队
- 任务按列表顺序依次执行,每行有独立的暂停、停止按钮
- 调整队列顺序即可改变处理优先级
实用技巧:配置一般的机器不建议手动并行多个任务,顺序跑完更稳,内存占用也可控。
实时录音转录:边说边出字 🎙
适合会议和讲座,录完即得文本。
- 在顶部录音区选好输入设备、模型和语言
- 点录音按钮开始,文本逐句显示
- 点停止结束,录音与转录结果存为任务,后续导出方式和普通转录一样
实用技巧:开始前把输出设备指向正确的会议室音箱,避免录进回音和系统提示音。
Buzz 字幕制作:编辑与格式导出
转录完先别急着导出,在查看器里过一遍时间轴。
- 点击转录任务打开转录查看器,每段都有开始/结束时间和文本
- 双击修改文字,拖动调整时间边界
- 用字幕调整器把过长的段落切分成目标长度
- 从导出菜单选择 SRT、VTT 或 TXT 保存
实用技巧:SRT 适合剪辑软件,VTT 适合网页播放,TXT 适合直接当文稿用,导出菜单里三类都能选。
Buzz 转录结果查看器:每段字幕的时间与文本可以直接编辑
Buzz Whisper 模型档位怎么选
| 档位 | 速度 | 内存占用 | 精度 | 推荐场景 |
|---|---|---|---|---|
| Tiny | 最快 | <1GB | 基础 | 快速草稿、实时转录 |
| Base | 快 | ~1GB | 良好 | 日常使用、平衡之选 |
| Medium | 中等 | ~3GB | 优秀 | 重要内容、正式转录 |
| Large | 慢 | ~8GB | 最佳 | 高精度要求、学术研究 |
建议先用 Base 出草稿确认内容没问题,正式产出再换 Medium 或 Large 重跑;有 NVIDIA 显卡时跑 Large 的时间成本比想象中低。
Buzz 调优:真正值得改的几项设置
- 模型管理:模型设置页可以按需搜索并下载不同档位的 Whisper 模型,平时只留 1–2 个常用档位。
- 偏好设置里改三项:默认输出目录、导出文件名模板(可包含日期、源文件名等变量)、常用操作快捷键。
- 字幕参数:目标长度 40–50 个字符是屏读上限;合并间隔 0.2–0.5 秒比较自然;长句多时启用按标点分割。
模型偏好页:按需搜索并下载 Whisper 各档位模型
偏好设置页:导出文件名模板在这里配置
两个落地工作流
会议实时转录:录音结束就有纪要
- 开会前打开 Buzz,录音设备指向会议室音箱
- 用 Base 模型开始实时录音转录,会议内容实时上屏
- 会后在转录查看器里修正关键人名和数字
- 纪要需要文字就导出 TXT,录像需要配字幕就导出 SRT
视频补字幕:MP4 直接进,SRT 直接出
- 课程视频的 MP4 直接导入,Buzz 通过 ffmpeg 处理音频
- 选 Medium 模型跑完整转录,拿到逐段时间戳
- 用字幕调整器把长段切成 40–50 字符
- 抽查几处时间轴不吻合的地方微调,导出 SRT 交给剪辑软件
字幕调整器:控制每段字幕的切分长度
Buzz 常见问题排障
Q:安装后启动报错,提示缺少依赖?A:多数是系统库缺失,Linux 下 pip 安装最容易碰到。补装 ffmpeg、libportaudio 等依赖后重启,基本能解决。
Q:模型下载失败或特别慢?A:先确认网络后重试;仍不行的话,手动把模型文件放到缓存目录~/.cache/Buzz/models/再启动程序。
Q:转录速度太慢?A:换成 Tiny 或 Base 模型,并关掉占内存的程序;有 NVIDIA 显卡的话启用 GPU 推理,提升最明显。
Q:识别准确率不理想?A:换更大的模型,并保证源音频背景噪音少;把高频专有名词写进"初始提示"也能明显改善。
更多细节可以查 官方文档,安装方式和各平台注意事项都有说明。
Buzz 装好后,随便找一段手头的短音频,点 "+" 导入,选 Base 点开始,一两分钟后你就能看到第一行转录结果。之后的事只是换模型、改时间轴、导出 SRT 这三个动作的组合。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考