Buzz 本地语音转文字:45 分钟录音离线转录,5 分钟跑通全流程
2026/9/7 9:04:57 网站建设 项目流程

Buzz 本地语音转文字:45 分钟录音离线转录,5 分钟跑通全流程

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

刚结束一场访谈,录音笔里躺着一段 45 分钟的对话,需要转成文字。上传给在线服务的话,谈话内容得先经过别人家的服务器。Buzz 就是为这种场景做的:离线音频转录全部跑在你自己的电脑上,由 Whisper 模型驱动,音频文件不出设备,转完还能直接导出 SRT 字幕。

Buzz 能做什么

一句话定位:Buzz 是一个桌面应用,用 Whisper 在本地把音频、视频转成文字和字幕,然后交给你在界面上编辑导出。

功能一句话说明典型用途
离线转录本地 Whisper 模型处理 MP3、WAV、M4A、MP4 等文件会议录音、访谈素材
批量处理多个文件排队依次转录,进度实时可见播客、课程系列批量归档
实时录音麦克风边录边转,文本随说话显示现场会议、课堂笔记
字幕编辑与导出逐段改时间轴和文字,导出 SRT / VTT / TXT给视频补字幕
多语言识别支持 99 种以上语言,可指定语言或自动检测外语材料、多语种内容

整条链路从读取音频到生成文本都在本机完成,敏感录音不用担心被上传。

Buzz 安装步骤:5 分钟跑起来

按平台选一种方式,命令都合在下面一个代码块里。

  • Windows:从发行版页面下载安装包,双击安装;程序未签名,遇到警告点"更多信息"→"仍要运行"。
  • macOS:下载 .dmg,拖进应用程序,首次启动允许打开即可(Intel 和 Apple silicon 都支持)。
  • Linux:推荐 Snap 版,先装 portaudio 等依赖;也可以走 Flatpak。
  • Python:需要系统里已有 ffmpeg,装完包直接用模块方式启动。
# Windows:下载安装包后双击安装(未签名,弹窗选"更多信息" → "仍要运行") # macOS:下载 .dmg 拖入应用程序文件夹 # Linux(Snap) sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz sudo snap connect buzz:password-manager-service # Linux(Flatpak 备选) flatpak install flathub io.github.chidiwilliams.Buzz # Python(跨平台,需先装好 ffmpeg) pip install buzz-captions python -m buzz

第一次转录只有 3 步:

  1. 点主界面左上角的 "+" 或按 Ctrl+O,选中音频文件
  2. 在任务行里选好模型,语言可以先留自动检测
  3. 点该行右侧的播放按钮开始,文本会实时出现在列表里

第一次选择模型时会自动下载到本地缓存目录~/.cache/Buzz/models/,建议在网络稳定的时候先跑一次。

Buzz 主界面:导入的文件排在任务列表里,每行可单独控制模型、语言和进度

Buzz 功能拆解:从转录到字幕

基础转录:单个文件出文本

最核心的链路——把文件丢进去,拿回全文和字幕文件。

  1. 导入文件,在任务行设置模型、语言和输出格式(TXT / SRT / VTT)
  2. 点播放开始,进度按段落推进,可以边跑边看文字
  3. 完成后用导出菜单选择格式和保存位置

实用技巧:语言框除了自动检测,也可以手动指定语种;"初始提示"(Initial prompt)里写上人名、产品名这类背景词,专有名词的识别会明显更稳。

批量队列:一次丢多个文件

文件多就排队,让队列自己按顺序跑完。

  1. 选择文件时按住 Ctrl(macOS 用 Cmd)多选,一次性入队
  2. 任务按列表顺序依次执行,每行有独立的暂停、停止按钮
  3. 调整队列顺序即可改变处理优先级

实用技巧:配置一般的机器不建议手动并行多个任务,顺序跑完更稳,内存占用也可控。

实时录音转录:边说边出字 🎙

适合会议和讲座,录完即得文本。

  1. 在顶部录音区选好输入设备、模型和语言
  2. 点录音按钮开始,文本逐句显示
  3. 点停止结束,录音与转录结果存为任务,后续导出方式和普通转录一样

实用技巧:开始前把输出设备指向正确的会议室音箱,避免录进回音和系统提示音。

Buzz 字幕制作:编辑与格式导出

转录完先别急着导出,在查看器里过一遍时间轴。

  1. 点击转录任务打开转录查看器,每段都有开始/结束时间和文本
  2. 双击修改文字,拖动调整时间边界
  3. 用字幕调整器把过长的段落切分成目标长度
  4. 从导出菜单选择 SRT、VTT 或 TXT 保存

实用技巧:SRT 适合剪辑软件,VTT 适合网页播放,TXT 适合直接当文稿用,导出菜单里三类都能选。

Buzz 转录结果查看器:每段字幕的时间与文本可以直接编辑

Buzz Whisper 模型档位怎么选

档位速度内存占用精度推荐场景
Tiny最快<1GB基础快速草稿、实时转录
Base~1GB良好日常使用、平衡之选
Medium中等~3GB优秀重要内容、正式转录
Large~8GB最佳高精度要求、学术研究

建议先用 Base 出草稿确认内容没问题,正式产出再换 Medium 或 Large 重跑;有 NVIDIA 显卡时跑 Large 的时间成本比想象中低。

Buzz 调优:真正值得改的几项设置

  • 模型管理:模型设置页可以按需搜索并下载不同档位的 Whisper 模型,平时只留 1–2 个常用档位。
  • 偏好设置里改三项:默认输出目录、导出文件名模板(可包含日期、源文件名等变量)、常用操作快捷键。
  • 字幕参数:目标长度 40–50 个字符是屏读上限;合并间隔 0.2–0.5 秒比较自然;长句多时启用按标点分割。

模型偏好页:按需搜索并下载 Whisper 各档位模型

偏好设置页:导出文件名模板在这里配置

两个落地工作流

会议实时转录:录音结束就有纪要

  1. 开会前打开 Buzz,录音设备指向会议室音箱
  2. 用 Base 模型开始实时录音转录,会议内容实时上屏
  3. 会后在转录查看器里修正关键人名和数字
  4. 纪要需要文字就导出 TXT,录像需要配字幕就导出 SRT

视频补字幕:MP4 直接进,SRT 直接出

  1. 课程视频的 MP4 直接导入,Buzz 通过 ffmpeg 处理音频
  2. 选 Medium 模型跑完整转录,拿到逐段时间戳
  3. 用字幕调整器把长段切成 40–50 字符
  4. 抽查几处时间轴不吻合的地方微调,导出 SRT 交给剪辑软件

字幕调整器:控制每段字幕的切分长度

Buzz 常见问题排障

Q:安装后启动报错,提示缺少依赖?A:多数是系统库缺失,Linux 下 pip 安装最容易碰到。补装 ffmpeg、libportaudio 等依赖后重启,基本能解决。

Q:模型下载失败或特别慢?A:先确认网络后重试;仍不行的话,手动把模型文件放到缓存目录~/.cache/Buzz/models/再启动程序。

Q:转录速度太慢?A:换成 Tiny 或 Base 模型,并关掉占内存的程序;有 NVIDIA 显卡的话启用 GPU 推理,提升最明显。

Q:识别准确率不理想?A:换更大的模型,并保证源音频背景噪音少;把高频专有名词写进"初始提示"也能明显改善。

更多细节可以查 官方文档,安装方式和各平台注意事项都有说明。

Buzz 装好后,随便找一段手头的短音频,点 "+" 导入,选 Base 点开始,一两分钟后你就能看到第一行转录结果。之后的事只是换模型、改时间轴、导出 SRT 这三个动作的组合。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询