Buzz 完整本地离线音频转录指南:免费把录音变成文字和字幕
2026/9/10 16:40:28 网站建设 项目流程

Buzz 完整本地离线音频转录指南:免费把录音变成文字和字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款基于 Whisper 的本地离线音频转录工具,跑在你自己的电脑上,把录音、视频、YouTube 链接里的语音免费转成文字和带时间轴的字幕,全程不上传、不联网也能用。

被录音堆成山的日子,该结束了

你大概遇到过这样的局面:三个月的播客访谈原声堆在文件夹里,加起来二十个小时。自己敲字,一分钟音频至少敲三分钟,算下来一周时间搭进去;丢给在线转写服务,一小时十几块先不说,文件得传到别人服务器——而受访对象明明交代过内容不能上云。偏偏公司内网还不稳定,排到一半任务断了,前功尽弃。

Buzz 就是冲着"贵、泄密、断网就瘫"这三件事来的:转录在你本机完成,一分钱不花,断网照常跑。下面带你从安装到出字幕,完整走一遍。

它和在线转写服务的差别在哪

先看一张表,几个关键维度一目了然:

维度在线转写服务Buzz
数据去向上传到第三方服务器始终留在本机
费用按时长计费或订阅开源免费
断网时直接不可用完整可用
硬件利用取决于对方服务器本机 GPU/CPU 直接干活
输出形态平台内查看为主TXT / SRT / VTT 文件自由导出

支撑这些差别的,是三个可以单独拎出来的底气:

  • 隐私是默认状态,不是付费选项。音频从导入到出结果,每一步都在你自己的磁盘上发生。商业会议、用户访谈这类敏感素材,不存在"先传上去再回来"的环节。
  • 开源意味着免费是长期的。代码完全开放,社区迭代活跃,你踩到的坑大概率在下个版本就被修掉,而不是一封工单等一周。
  • 后端选项给得很足。NVIDIA 显卡走 CUDA 加速,Mac 走 Apple Silicon 优化,还有 Whisper.cpp 后端兼容 Vulkan、吃集成显卡甚至纯 CPU。没有独显只是快慢问题,不是能不能用的问题。

五步跑通你的第一个转录任务

第一步:安装。去下载对应系统的安装包:Windows 双击安装程序(未签名,出现警告时选"仍要运行");macOS 装.dmg;Linux 用 Flatpak 或 Snap 一条命令装好。

第二步:把音频丢进来。Buzz 认 MP3、WAV、FLAC、MP4、AVI 这些主流格式,导入入口有四个,挑顺手的:工具栏上的"+"按钮、快捷键Ctrl+O(macOS 为 Cmd+O)、直接把文件拖进窗口,或者粘贴一个YouTube 链接——它会自动拉取音频进流程,做字幕不用再手动下载一遍。

第三步:配置任务。导入后面板里会展开任务类型、语言、模型、导出格式几个选项,后面一节细讲,第一次全用默认也能跑。

第四步:点运行。任务进队列开始处理,进度条在任务列表里实时更新,多个文件排队并发,不用干等。

第五步:拿结果。状态变成"Completed"后,双击那一行打开转录查看器:逐句文本带时间戳,可以搜索、可以跟着音频播放对照、可以直接导出成文件。

四个参数,决定转录结果好坏

任务类型:转录还是翻译。选"转录",输出和原声同语言;选"翻译",Buzz 会把非英语内容直接转成英文文本。做中英对照稿、给外文访谈出英文底稿,就靠切换到翻译。

语言设置:能手动就别自动。自动检测大部分时候靠谱,但混着口音、夹杂外语的音频容易判错语言,一错全错。事先知道录音是什么语言,就手动指定,准确率会稳很多。

模型大小:速度和精度的天平。从 Tiny 到 Large 分好几档,档位在偏好设置的"模型"页里,已下载的显示在列,没下载的可以一键补。日常材料 Small/Medium 是甜点区间;Tiny/Base 快,适合实时场景和低精度要求;Large 准,重要内容和专业术语多的材料值得等它。

输出格式:TXT、SRT、VTT 可以多选。要纯文字稿勾 TXT;给视频配字幕勾 SRT 或 VTT。勾选是独立的,一次处理可以同时产出三份文件,省得重复跑。

拉开差距的几个进阶功能

🔊 字幕整形:把一屏放不下的字幕救回来

长录音转出的字幕常有两个毛病:一行太长观众读不完,或者一句被切成三行频繁跳。打开转录查看器里的Resize,设一个目标最大长度,它会按标点和语义重新断句,把每行裁得整齐。开过"词级时间戳"的转录还能更进一步:按停顿间隙合并碎字幕、按标点拆长句、按最大长度强制分块,甚至统一延长每条字幕的停留时间。适配不同视频平台的字幕规范,基本就是改这几个数字的事。

实时转录:边说话边出字

Buzz 能直接吃麦克风输入,人还在说,屏幕上文字已经蹦出来了,还能投到一个独立的演示窗口里放大展示。线上会议边开边出纪要、课堂实时记笔记、直播加字幕,都是它的典型主场。

说话人识别:多人对话各归各位

多人录音最烦的是通篇分不清谁在说话。在转录查看器里点Identify speakers,Buzz 会自动给不同发言者的句子打上标签,还能试听某位说话人的十秒片段确认身份,然后把"Speaker 0"改成对方的真名。勾选合并选项后,同一人的连续句子会并成一段,访谈整理直接省掉一半工时。

语音提取与降噪:嘈杂环境的保险丝

环境杂、背景音乐重的时候,转录前先勾"提取语音"(Extract speech),把人声分离到独立音轨再识别,准确率提升明显。另外还有个 DeepFilterNet 降噪插件,转录前用模型把背景噪声滤掉,吵录音也能救一救。

让 Buzz 替你值班:监控、插件和命令行

文件夹监控:在偏好设置里指定一个监控目录,之后新音频文件一落进去,Buzz 自动开跑,全程无人值守。每周固定更新的播客、攒了一堆待处理的课程录音,最适合交给它。

插件系统:Help → Plugins 里管理,开关、排序、配参数都行。内置插件包括:AI 摘要(转录完自动提炼要点,走 OpenAI 兼容接口)、字幕自动整形(转完直接按字幕规格重组)、跳过已转录文件(批量重跑时自动识别已完成项,避免重复劳动)、增强语言检测(用本地 Whisper 先判语言再转录)、导出 DOCX(结果直接变 Word 文档)、DeepFilterNet 降噪。要哪个开哪个。想看插件实现可以直接翻 buzz/plugins/。

命令行:给脚本党留的后门,批量任务和定时脚本都好用。完整参数见 docs/docs/cli.md。

# 转录单个文件,指定中文,同时导出 SRT 字幕、VTT 和 TXT 三种格式 buzz add --task transcribe --language zh --srt --vtt --txt interview.mp3 # 用 Whisper.cpp 后端把法语访谈翻译成英文 buzz add --task translate --model-type whispercpp --language fr interview-fr.mp3

四类人,四种用法,照抄就行

  • 学生:课程录音导入 → 转录 + 时间戳 → 文字笔记,复习时点哪句跳哪句,多语言课程也能直接出字幕。
  • 视频创作者:成片视频导入 → 转录 + Resize 统一行宽 → 导出 SRT 进剪辑软件,字幕环节从半小时手工活变几分钟自动活。
  • 职场人:会议实时转录 + 说话人识别 → 结构清晰的纪要当场生成,敏感内容全程不出本机。
  • 研究者:一文件夹访谈录音 + 文件夹监控 → 批量转写出说话人标签 → 文本直接进内容分析流程。

把准确率再提五点的实战技巧

  1. 先定模型再调别的。重要材料上 Large 档,日常材料 Small 起步;同一份音频先跑一遍小模型摸底,确认值得再换大模型重跑,别一上来就全用大模型干等。
  2. 让硬件配得上模型。有 NVIDIA 显卡就确认 CUDA 后端生效,速度能快数倍;Mac 直接走 Apple Silicon 优化路径;纯 CPU 环境模型降一档,体验更顺。
  3. 输入先做减法。录音时尽量安静、音量适中;事后补救就勾"提取语音"或开降噪插件,噪声少一分,错字少一片。
  4. 把专有名词塞进初始提示词。高级设置里的 Initial prompt 框,填入人名、地名、专业术语,这些词的识别率肉眼可见地涨,技术讲座和医学访谈尤其受益。
  5. 批量任务组合拳。文件夹监控负责进料,"跳过已转录"插件负责去重,小模型先过一遍、大模型挑重点重跑——三招叠上去,批量处理的等待时间能砍掉大半。

常见疑问速答

Buzz 必须联网吗?不用。所有处理都在本机,只有你主动选 OpenAI API 后端时才需要网络。

支持多少种语言?99 种以上,中、英、日、法、德等主流语言全覆盖,识别和翻译都支持。

处理速度如何?取决于音频长度、模型大小和硬件。有 GPU 的机器通常能做到接近实时甚至更快;慢就换 Whisper.cpp 后端或降一档模型。

音频有长度限制吗?没有硬性限制,几秒钟的语音到几小时的长录音都能处理。

离线电脑怎么装?在联网电脑上把模型下好,整份拷到离线机器的相同缓存目录(偏好设置里可一键打开该目录),之后断网照常转录。

收尾

Buzz 做的其实不只是"转文字"这件事:它把转录从一项要花钱、要上传、看网络脸色的外包活,变成了你电脑里一项随时可用、完全可控的能力。录音不再只是躺在硬盘里、再也不会被第二遍翻出的文件,而是可搜索、可剪辑、可进工作流的文字资产。现在就把 Buzz 装上,丢进你第一段落灰的录音——进度条走完的那一刻,你会明白这一下午值了。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询