TMSpeech:Windows 免费离线语音转文字工具实时字幕完整指南
【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech
TMSpeech 是一款完全免费、开源的 Windows 离线语音转文字工具:它实时捕获电脑正在播放的声音,并转成屏幕上滚动的字幕,识别全程在本地完成,不经过任何云端服务器。即使你把音量彻底关掉,它依然能"听"到系统声音。
一、会议上被点名时,如何快速"回神"?
线上会议开到二十分钟,你恰好走神,领导突然点名:"刚才小明提的方案,你觉得怎么样?"——脑子里一片空白。如果字幕窗口一直在屏幕上滚动,扫一眼就能接上话。这个场景,正是项目被戏称为"腾讯会议摸鱼工具"的由来。
TMSpeech 的定位非常纯粹:不搞云服务、不注册账号、不弹广告。声音从你的电脑里来,文字显示在你的屏幕上,识别的每一步都没有离开这台机器。
二、三个词定义它凭什么值得装
免费、全程离线、低占用——在普通笔记本上实测 CPU 占用普遍低于 5%,内存占用在几百 MB 量级,老机器边跑边办公也没压力。把这三个词放在一起,市面上同类工具屈指可数。
三、能力总览:一张表看懂它能做什么
| 能力维度 | TMSpeech 的表现 | 对普通用户的意义 |
|---|---|---|
| 音频来源 | 系统内录、麦克风等 3 种音源 | 会议、网课、录音全覆盖 |
| 识别方式 | 本地流式识别,全程离线 | 隐私安全,断网也能用 |
| 资源占用 | CPU 普遍 < 5%,内存几百 MB | 老电脑也能边用边干别的 |
| 字幕展示 | 无边框悬浮窗,可拖动缩放 | 像歌词一样跟读,不挡视野 |
| 历史记录 | 按日期自动存到 TMSpeechLogs 目录 | 会后一键整理纪要 |
| 识别引擎 | CPU / GPU / 外部命令三套可切换 | 按性能需求自由选 |
| 扩展能力 | 插件化架构,模型可在线安装 | 换语言、换模型都不难 |
四、三步快速上手:从下载到第一句字幕 🚀
第一步:获取软件
从项目的 Release 页面下载最新版本,解压后双击TMSpeech.exe即可运行。想折腾源码的,也可以直接克隆仓库:
git clone https://gitcode.com/gh_mirrors/tm/TMSpeech主界面源码在 src/TMSpeech.GUI/Views/MainWindow.axaml,想了解字幕窗口怎么实现的,打开看看就懂了。
第二步:安装语言模型
首次运行后进入设置界面,在左侧导航找到「资源」页。语音识别依赖语言模型,这里列出了全部可安装的资源:点「中文模型」旁边的「安装」按钮,等下载完成,状态就会变成「已安装」。内置资源放在应用目录的plugins/文件夹,你自己装的资源则存放在%AppData%/TMSpeech/plugins/。
第三步:开始识别,看字幕实时滚动
回到主界面点开始按钮,红色计时开始跳动,字幕窗口就会跟着电脑里的声音实时更新。识别结果按日期自动保存到「我的文档」下的TMSpeechLogs文件夹,随时打开回顾。
五、原理拆解:耳朵、大脑和字典是怎么配合的 🤔
把 TMSpeech 想象成一支三人小队。耳朵是音频源:它用 WASAPI 环回捕获技术,把电脑正在播放的声音像"录内音"一样抓下来——即使你完全关闭电脑音量也照样能识别,因为捕获发生在系统内部,不经过扬声器。大脑是识别引擎:负责把音频流翻成文字,一共三套可选:Sherpa-Onnx(基于 CPU,资源占用最低,日常首选)、Sherpa-Ncnn(可调用 GPU,追求极限速度)、命令行识别器(接入你自己的任何识别程序)。字典是语言模型:决定大脑的知识水平,中文、英文、中英双语按需安装,装哪个用哪个。
为什么本地识别又快又安全?云端识别像"把纸条寄到外地请人翻译再寄回来",路上有延迟、有被拆看的风险;本地识别像"翻译官就住隔壁",纸条递过去,回答瞬间就回来了。再叠加流式识别——边采集边出结果,一句还没说完,上一句的字幕已经滚上屏幕。
六、三个真实场景,感受它的实际价值
会议纪要自动生成
痛点是:会中记笔记累,会后整理成文档更累。解法很简单——开会时开着 TMSpeech 就行,散会后打开历史记录,右键全选、复制,一份完整纪要到手。老板让你总结、同事问刚才说了啥,瞟一眼字幕就能从容应答。
网课复习提速
录播课或直播课时,把字幕窗口拖到屏幕下方,老师讲的重点同步变成文字。跟不上手写速度没关系,课后打开TMSpeechLogs文件夹,一整节课的文字笔记已经自动整理好;外语课同样适用,边看视频边看字幕,相当于白送一个"万能字幕组"。
隐私敏感场合的安心之选
涉及商业机密、未公开项目或私人对话时,很多人第一反应是"不敢用云端识别"。TMSpeech 的全程离线恰好解决这个顾虑:语音数据在本地完成识别,不经过任何第三方服务器。聊什么、录什么,只有你和你的电脑知道。
七、进阶玩法:三套引擎与插件化生态 🔧
引擎怎么选?日常办公选Sherpa-Onnx最省资源;直播、游戏等追求速度的场景换Sherpa-Ncnn开启 GPU 加速;想换更强的模型,它基于 sherpa-onnx 框架,支持其全部流式模型,在设置里指定模型路径即可升级识别精度。
命令行识别器是技术玩家的后花园:选用它之后,程序会启动你指定的外部命令,读取标准输出作为字幕结果——单个换行更新当前句子,多个换行表示句子完成。仓库的 external_recognizer/ 目录提供了完整的 Python 示例脚本,接入 Whisper、SenseVoice 等任意引擎都很方便。所有插件的实现集中在 src/Plugins/ 目录,音频源的具体实现可以看 src/Plugins/TMSpeech.AudioSource.Windows/。
外观与日常管理同样省心:字幕窗口支持无边框悬浮、任意拖动缩放,锁定后鼠标点击可穿透窗口,看视频完全不挡操作;字体、颜色、阴影、对齐方式都能在「显示」设置里微调,全部配置项定义在 src/TMSpeech.Core/ConfigTypes.cs。程序常驻系统托盘,开始/停止、锁定/退出都能右键一键完成。
八、常见问题速查 ❓
| 问题 | 快速解决方案 |
|---|---|
| 识别准确率一般 | 选对语言模型;尽量在安静环境使用 |
| 无法捕获系统音频 | 音源选「系统音频」;必要时启用立体声混音 |
| CPU 占用偏高 | 切到 Sherpa-Onnx,或换更轻量的模型 |
| 历史记录找不到 | 默认在「我的文档/TMSpeechLogs」,可在设置改路径 |
| 配置乱了想重置 | 运行安装包里的重置配置脚本 |
| 想用自己的识别程序 | 切「命令行识别器」,参考官方示例脚本 |
| 想换更强的识别模型 | 下载 sherpa-onnx 流式模型,在设置里填路径 |
九、行动清单:现在就开始用 ✅
- 下载 TMSpeech,双击运行
- 在「资源」页安装中文语言模型
- 点开始,让字幕跟着你的网课/会议动起来
- 会后打开
TMSpeechLogs,带走现成的文字纪要
如果你符合下面任意一条,它就该放进你的工具箱:
- 开会、上课时总担心漏掉重点
- 担心语音数据被上传到云端
- 电脑配置一般,需要轻量级方案
- 想要完全免费、无广告的开源工具
免费、离线、隐私安全、低占用——这四个词就是 TMSpeech 的全部承诺。装上模型,然后安心走神,让字幕替你记住一切。
【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考