Buzz:本地离线音频转录完整指南,5 分钟转出第一份文字稿
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款免费的桌面程序,用 OpenAI Whisper 在本地完成离线音频转录:MP3、WAV、MP4 等文件不上传任何服务器,转完即得 TXT、SRT、VTT 三种格式的文字稿。它解决的是"手里有一堆录音、需要文字稿、又不想交给云端处理"的常见需求。对隐私敏感、要批量出稿、或给视频做本地字幕的人来说,它是目前最省事的本地方案之一。
它最擅长的三件事
- 批量本地转录。本地音视频文件和网页链接都能导入,一次选多少个就排多少个,按顺序处理;内置 Whisper、Faster Whisper、Whisper.cpp、Hugging Face、OpenAI API 共 5 种后端,同一条队列可以混用。
- 麦克风实时转录。点工具栏的麦克风按钮就开始监听,边说边出字;还带一个独立的演示窗口,适合讲座、发布会这种"正在发生"的内容。
- 说话人识别与字幕输出。开启识别后,转录稿会标注不同说话人;结果可导出 SRT、VTT 字幕文件,直接挂到视频上使用。
5 分钟上手
推荐用 pip 安装,两条命令:
pip install buzz-captions python -m buzz- 程序启动后,点工具栏的 + 号,选择一个本地音频文件(也可以粘贴视频网址,先下载再转录);
- 在任务行里选好引擎和模型大小,点开始;
- 行状态变为 Completed 后,双击该行进入时间轴结果界面,逐行核对文字。
常用配置项说明
下面 5 个参数最直接影响结果,按"参数名|作用|怎么选"记:
- **--model-type(引擎)**|5 种后端里选一个,可选 whisper、whispercpp、fasterwhisper、huggingface、openaiapi|Whisper.cpp 偏速度,Faster Whisper 在 GPU 上表现好,拿同一段音频各试一次最直观;
- **--model-size(模型大小)**|tiny、base、small、medium、large 五档,越大越准也越慢|日常会议录音用 small 或 medium,重要访谈、术语多的内容用 large;
- **--language(语言)**|指定语言代码,留空则自动检测|确定语言时直接填,检测更稳;
- **-w(词级时间戳)**|生成 word-level timestamps|后续用 Merge 方式重排字幕时必须开启它,而 Resize 方式要求不开启;
- Resize 三参数|Desired subtitle length 控制单行字幕最大字符数,默认 42;Merge by gap 把间隔小于 0.2 秒的两条字幕合并;Split by punctuation 遇句末标点强制断行,正则默认已覆盖中英文标点。
各引擎的具体调用逻辑,可以从源码目录 buzz/transcriber/ 入手看。
进阶玩法
- 命令行批量:跳过图形界面直接跑任务,加
--hide-gui适合放进脚本。常用选项:-m指定引擎、-s模型大小、-l语言、--srt/--vtt/--txt指定导出格式、-d输出目录,完整参数表见 docs/docs/cli.md。
python -m buzz add -m whispercpp -s medium -l en --srt -d ./out ./interview.mp3- 监听文件夹自动转录:开启 Watch folder 后,放进目录的新音频自动排队处理,整批文件不用手动选。
适合谁,从哪开始
- 录音涉及隐私、不能上传云端的,用它做离线音频转录;
- 手里有一批音频要批量出文字稿的,用任务队列加命令行处理;
- 给视频做本地字幕、不想走在线服务的,转完直接导出 SRT 挂到视频上。
第一次用,建议先用 small 模型跑一段 1 分钟左右的短音频:熟悉队列、结果界面和导出流程后,再换 large 模型处理正式内容。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考