TMSpeech:Windows 免费离线语音转文字工具实时字幕完整指南
2026/9/21 23:03:40 网站建设 项目流程

TMSpeech:Windows 免费离线语音转文字工具实时字幕完整指南

【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech

TMSpeech 是一款完全免费、开源的 Windows 离线语音转文字工具:它实时捕获电脑正在播放的声音,并转成屏幕上滚动的字幕,识别全程在本地完成,不经过任何云端服务器。即使你把音量彻底关掉,它依然能"听"到系统声音。

一、会议上被点名时,如何快速"回神"?

线上会议开到二十分钟,你恰好走神,领导突然点名:"刚才小明提的方案,你觉得怎么样?"——脑子里一片空白。如果字幕窗口一直在屏幕上滚动,扫一眼就能接上话。这个场景,正是项目被戏称为"腾讯会议摸鱼工具"的由来。

TMSpeech 的定位非常纯粹:不搞云服务、不注册账号、不弹广告。声音从你的电脑里来,文字显示在你的屏幕上,识别的每一步都没有离开这台机器。

二、三个词定义它凭什么值得装

免费全程离线低占用——在普通笔记本上实测 CPU 占用普遍低于 5%,内存占用在几百 MB 量级,老机器边跑边办公也没压力。把这三个词放在一起,市面上同类工具屈指可数。

三、能力总览:一张表看懂它能做什么

能力维度TMSpeech 的表现对普通用户的意义
音频来源系统内录、麦克风等 3 种音源会议、网课、录音全覆盖
识别方式本地流式识别,全程离线隐私安全,断网也能用
资源占用CPU 普遍 < 5%,内存几百 MB老电脑也能边用边干别的
字幕展示无边框悬浮窗,可拖动缩放像歌词一样跟读,不挡视野
历史记录按日期自动存到 TMSpeechLogs 目录会后一键整理纪要
识别引擎CPU / GPU / 外部命令三套可切换按性能需求自由选
扩展能力插件化架构,模型可在线安装换语言、换模型都不难

四、三步快速上手:从下载到第一句字幕 🚀

第一步:获取软件

从项目的 Release 页面下载最新版本,解压后双击TMSpeech.exe即可运行。想折腾源码的,也可以直接克隆仓库:

git clone https://gitcode.com/gh_mirrors/tm/TMSpeech

主界面源码在 src/TMSpeech.GUI/Views/MainWindow.axaml,想了解字幕窗口怎么实现的,打开看看就懂了。

第二步:安装语言模型

首次运行后进入设置界面,在左侧导航找到「资源」页。语音识别依赖语言模型,这里列出了全部可安装的资源:点「中文模型」旁边的「安装」按钮,等下载完成,状态就会变成「已安装」。内置资源放在应用目录的plugins/文件夹,你自己装的资源则存放在%AppData%/TMSpeech/plugins/

第三步:开始识别,看字幕实时滚动

回到主界面点开始按钮,红色计时开始跳动,字幕窗口就会跟着电脑里的声音实时更新。识别结果按日期自动保存到「我的文档」下的TMSpeechLogs文件夹,随时打开回顾。

五、原理拆解:耳朵、大脑和字典是怎么配合的 🤔

把 TMSpeech 想象成一支三人小队。耳朵是音频源:它用 WASAPI 环回捕获技术,把电脑正在播放的声音像"录内音"一样抓下来——即使你完全关闭电脑音量也照样能识别,因为捕获发生在系统内部,不经过扬声器。大脑是识别引擎:负责把音频流翻成文字,一共三套可选:Sherpa-Onnx(基于 CPU,资源占用最低,日常首选)、Sherpa-Ncnn(可调用 GPU,追求极限速度)、命令行识别器(接入你自己的任何识别程序)。字典是语言模型:决定大脑的知识水平,中文、英文、中英双语按需安装,装哪个用哪个。

为什么本地识别又快又安全?云端识别像"把纸条寄到外地请人翻译再寄回来",路上有延迟、有被拆看的风险;本地识别像"翻译官就住隔壁",纸条递过去,回答瞬间就回来了。再叠加流式识别——边采集边出结果,一句还没说完,上一句的字幕已经滚上屏幕。

六、三个真实场景,感受它的实际价值

会议纪要自动生成

痛点是:会中记笔记累,会后整理成文档更累。解法很简单——开会时开着 TMSpeech 就行,散会后打开历史记录,右键全选、复制,一份完整纪要到手。老板让你总结、同事问刚才说了啥,瞟一眼字幕就能从容应答。

网课复习提速

录播课或直播课时,把字幕窗口拖到屏幕下方,老师讲的重点同步变成文字。跟不上手写速度没关系,课后打开TMSpeechLogs文件夹,一整节课的文字笔记已经自动整理好;外语课同样适用,边看视频边看字幕,相当于白送一个"万能字幕组"。

隐私敏感场合的安心之选

涉及商业机密、未公开项目或私人对话时,很多人第一反应是"不敢用云端识别"。TMSpeech 的全程离线恰好解决这个顾虑:语音数据在本地完成识别,不经过任何第三方服务器。聊什么、录什么,只有你和你的电脑知道。

七、进阶玩法:三套引擎与插件化生态 🔧

引擎怎么选?日常办公选Sherpa-Onnx最省资源;直播、游戏等追求速度的场景换Sherpa-Ncnn开启 GPU 加速;想换更强的模型,它基于 sherpa-onnx 框架,支持其全部流式模型,在设置里指定模型路径即可升级识别精度。

命令行识别器是技术玩家的后花园:选用它之后,程序会启动你指定的外部命令,读取标准输出作为字幕结果——单个换行更新当前句子,多个换行表示句子完成。仓库的 external_recognizer/ 目录提供了完整的 Python 示例脚本,接入 Whisper、SenseVoice 等任意引擎都很方便。所有插件的实现集中在 src/Plugins/ 目录,音频源的具体实现可以看 src/Plugins/TMSpeech.AudioSource.Windows/。

外观与日常管理同样省心:字幕窗口支持无边框悬浮、任意拖动缩放,锁定后鼠标点击可穿透窗口,看视频完全不挡操作;字体、颜色、阴影、对齐方式都能在「显示」设置里微调,全部配置项定义在 src/TMSpeech.Core/ConfigTypes.cs。程序常驻系统托盘,开始/停止、锁定/退出都能右键一键完成。

八、常见问题速查 ❓

问题快速解决方案
识别准确率一般选对语言模型;尽量在安静环境使用
无法捕获系统音频音源选「系统音频」;必要时启用立体声混音
CPU 占用偏高切到 Sherpa-Onnx,或换更轻量的模型
历史记录找不到默认在「我的文档/TMSpeechLogs」,可在设置改路径
配置乱了想重置运行安装包里的重置配置脚本
想用自己的识别程序切「命令行识别器」,参考官方示例脚本
想换更强的识别模型下载 sherpa-onnx 流式模型,在设置里填路径

九、行动清单:现在就开始用 ✅

  1. 下载 TMSpeech,双击运行
  2. 在「资源」页安装中文语言模型
  3. 点开始,让字幕跟着你的网课/会议动起来
  4. 会后打开TMSpeechLogs,带走现成的文字纪要

如果你符合下面任意一条,它就该放进你的工具箱:

  • 开会、上课时总担心漏掉重点
  • 担心语音数据被上传到云端
  • 电脑配置一般,需要轻量级方案
  • 想要完全免费、无广告的开源工具

免费、离线、隐私安全、低占用——这四个词就是 TMSpeech 的全部承诺。装上模型,然后安心走神,让字幕替你记住一切。

【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询