三款实测好用的免费文字转语音小工具:在线、离线、命令行全场景覆盖
2026/9/11 13:16:18 网站建设 项目流程

你平时有没有遇到过这种场景:辛辛苦苦写完一篇文章,想顺手做成音频发出去,结果在软件商店里翻了一圈,要么收费贵得离谱,要么声音像机器人一样僵硬;又或者你想给家里的老人“读”一份长文档,自己又没时间一直念;再比如你在折腾安卓模拟器里的陪伴类应用,想把一段对话转成语音播放,却发现系统自带的TTS声音实在没法听。我自己经常和文字转语音、小工具这两类东西打交道,试过市面上不少方案,最后真正留下来常驻电脑和手机里的,其实就三款。

这篇文章不搞大而全的评测,只把这三款我实测过、在不同场景下确实好用的文字转语音小工具拆开讲清楚:它们各自适合谁、怎么用最顺手、有哪些坑要提前避开。不管你是只需要临时听个网页、还是要批量把小说转成有声书,甚至想在命令行里自动生成配音,下面总有一款适合你。

1. 先搞清楚:你想要的到底是哪种“文字转语音”

很多人在这一步就已经走偏了。看到“文字转语音”就以为随便装一个工具就行,结果用下来发现要么音色太少,要么格式不对,要么转出来的音频有杂音。其实不同工具的设计目标完全不同,选错方向后面怎么调都别扭。

1.1 三款工具定位完全不同,别指望一款通吃

我推荐的三款分别是:微软 Edge 浏览器自带的“大声朗读”、老牌本地软件 Balabolka、以及命令行神器 edge-tts。它们的定位可以一句话概括:Edge 是“零门槛在线试听”,Balabolka 是“离线批量转换专家”,edge-tts 是“可编程的免费语音引擎”。

这三款工具背后对应的使用场景非常清晰。Edge 适合你正在电脑前处理文档,想快速把屏幕上的文字“读”出来,不需要保存音频文件;Balabolka 适合你手头有一堆 txt、epub 甚至网页文件,希望一次性转换成 MP3 或 WAV 存在硬盘里慢慢用;而 edge-tts 则适合有自动化需求的朋友,比如写个脚本定时把 RSS 文章生成音频,或者把聊天记录批量转成语音包,再丢给其他程序去播放。

如果你买了一款“什么都能干”的商业软件,很容易陷入功能臃肿却都不精的尴尬。反而不如按需选择,把这些免费小工具组合使用。我自己现在的日常流程是:临时听文用 Edge,批量整理有声书用 Balabolka,需要给项目批量配音时直接跑 edge-tts 脚本。三者各司其职,效率最高。

1.2 选型之前先看这几个参数,省得来回折腾

判断一款文字转语音工具是否适合你,别看宣传页面,直接看五个核心参数:音质、语种支持、导出格式、批量能力、以及是否免费商用。音质决定了你能不能听下去,语种支持决定了中文以外的需求能不能覆盖,导出格式决定了后续能不能在剪辑、播放器里直接使用,批量能力决定了长文本处理时要不要手动一页页复制,免费商用则是很多自媒体朋友的硬性门槛。

这五条里最容易被忽略的是“免费商用”。有些工具个人用着不花钱,但你一旦把生成的音频放到带广告、带收益的账号里,就涉及版权问题了。后面我会在常见问题部分专门说这事儿,但选型时请一定要留意。除此之外,还有一个很实际的标准:工具是否需要联网。如果你经常在没网的环境下工作,那么本地离线方案比在线方案优先级高得多。基于这些标准,下面三款刚好覆盖了在线、本地、命令行三类典型需求。

2. 第一款:Edge 浏览器自带朗读——零门槛的在线方案

别小看浏览器自带功能,很多人天天用 Edge 上网,却不知道它内置了一套非常不错的文字转语音能力。这个功能叫“大声朗读”,在桌面版、手机版都有,不需要安装任何插件,打开就能用。

2.1 打开就能用,语音质量惊喜

使用方式很简单:在 Edge 浏览器里打开一个网页或 PDF 文档,按 Ctrl+Shift+U(Mac 上是 Cmd+Shift+U)就能直接朗读当前页面。你也可以在页面右键菜单里找到“大声朗读”,或者从地址栏右侧的图标进入。启动之后页面会变成“阅读模式”,顶部出现播放控制条,可以暂停、快进、调整语速。

我第一次用的时候还挺惊讶的——默认的中文语音是微软的神经网络语音,听起来非常自然,停顿和语气都接近真人,完全不是以前那种一字一顿的机械感。在桌面版里甚至可以切换语音角色,比如“Microsoft Xiaoxiao”(晓晓)和“Microsoft Yunxi”(云希),可调语速和音调,选择很丰富。对于临时场景来说,这个效果已经足够让人满意了。

2.2 适合场景:临时朗读、睡前听文、快速校对

我个人最常用它做两件事:一是长文章校对,写东西写得久了眼睛容易“自动脑补”,把稿子用朗读播出来,很多语病和错别字能直接听出来;二是睡前“听书”,把想读的文章往收藏夹一扔,手机版 Edge 打开收藏夹,一键开始朗读,关屏也能继续播放,比专门下载付费听书 App 要省心得多。

还有一个很多人没发现的用法:在阅读模式下,Edge 会自动清理掉网页上的广告、侧栏和弹窗,只留下正文内容。这样朗读的时候不会出现读到一半突然插一句广告词的尴尬局面。经过我测试,大多数资讯类网站都能正确识别正文,只有少数特殊排版页面需要手动选中文字后右键选择“在阅读模式中打开”。

2.3 隐藏技巧:如何把朗读声音“留下来”

Edge 的“大声朗读”有一个明显的限制:它本身不提供直接导出音频的按钮。如果你只是听,那完全没问题;但如果你想把这段朗读存成 MP3 文件,就不能靠点击实现了。我一般会分情况处理:如果是短内容,可以用系统自带的录音功能循环内录;如果是长内容,干脆复制正文,丢给后面两款工具去做转换,速度和稳定性都好得多。

所以我对 Edge 的定位很明确——它是“随取随用”的在线朗读方案,不适合当作批量生产工具。一旦你有保存音频的需求,请直接把注意力放到下一款工具上,那才是真正干活的家伙。

3. 第二款:Balabolka——本地批量转换的老牌工具

Balabolka 是一款在 Windows 平台上存在了很多年的免费文字转语音工具,体积小、无广告、不联网也能用,核心功能就是帮你把文本文件批量转成语音文件。它本身不内置语音,而是调用系统里已经安装好的语音引擎,所以灵活性和自由度非常高。

3.1 为什么推荐它:离线、批量、格式全

Balabolka 最让我佩服的是它对文本格式的支持范围:txt、doc、docx、epub、pdf、html、甚至 SRT 字幕文件都能直接打开。这意味着你从网上下载的电子书、自己写的 Word 文档、保存的网页正文,几乎都能直接拖进去处理,省去了复制粘贴的功夫。

输出格式方面也相当全,支持 WAV、MP3、OGG、WMA 等常见格式。尤其值得一提的是,它可以把整个文档自动按章节或段落拆分成多个音频文件,也可以把多个文本合并成一个长音频。这个特性在做有声书时简直是神级功能——你只需要调整好拆分规则,剩下的事软件全帮你干。

3.2 实操步骤:配置文件、调用语音引擎、输出 MP3

第一次使用 Balabolka 时,建议按我这个流程走一遍,能避开不少弯路。首先打开软件,在工具栏的“语音”下拉菜单里选择你系统里已有的语音角色。如果列表里什么都没有,说明系统没有安装任何语音包,需要先到系统设置里添加。

选好语音后,点“文件”打开一个文本文件,然后点一下“文本转语音”区域里的播放按钮,先试听 10 秒钟,确认语速和音调是否符合预期。如果觉得语速不合适,在“语音设置”里调整“语速”滑块,中文一般调成“0”到“1”之间比较自然。确认没问题后,点“文件”下的“保存音频文件”,选择输出格式,设置文件名,软件就会开始批量生成。

整个过程是离线运行的,所以几百页的长篇小说转换也不容易断线,唯一要关注的是 CPU 占用。某些神经网络语音引擎在转换时会吃满单核 CPU,此时电脑会有轻微卡顿,但还在可接受范围内。如果你要转化超大文件,建议睡前挂机,第二天起来收文件。

3.3 避坑指南:系统自带语音音质差,先装语音包再动手

很多朋友用了 Balabolka 之后第一反应是“这声音怎么这么难听”。别急着骂软件,问题往往出在语音引擎上。Windows 自带的系统语音通常是老一代的 SAPI5 引擎,只适合做简单提醒,不适合朗读长文。想让它好听,你需要额外安装高质量的中文语音包。

最简单的路径是在 Windows 设置里打开“时间和语言”,进入“语言和区域”,找到中文(中国)的“语言选项”,然后在“语音”功能里下载一个支持“自然”音质的中文语音。部分语音需要联网下载,但都是微软官方渠道,安全没有问题。装好之后回到 Balabolka,重新启动软件,语音列表里就会出现新的声音。这一步做完,你听到的效果会和 Edge 朗读差不多自然,而且还能批量导出,这才是 Balabolka 的正确打开方式。

还有个很容易被忽略的坑:如果你把生成的音频拿到其他设备上播放,记得先确认输出格式是否兼容。MP3 是通用性最好的,但 Balabolka 默认的 MP3 编码需要依赖系统的解码器,如果你系统里没有,它会提示无法编码。最简单的解决办法是输出 WAV 格式,再用任意转换软件转成 MP3。不过就我自己使用而言,Windows 10/11 自带的媒体基础基本都能处理 MP3 编码,遇到问题再换 WAV 也不迟。

4. 第三款:edge-tts——程序员最爱的命令行黑武器

如果你愿意在键盘上多敲几行命令,那我特别推荐你试试 edge-tts。它本质上是一个基于 Python 的命令行工具,通过调用微软 Edge 的在线语音合成接口来生成音频。这也是为什么叫“edge-tts”——它不是微软官方产品,而是社区开发者逆向整理出来的一个免费方案,音质和 Edge 浏览器里的朗读基本一致。

4.1 它能做什么:免费调用微软神经网络语音,输出 MP3

edge-tts 最大的优势是集成了微软几乎所有神经网络语音角色,包括中文、英文、日文、韩文等多种语言,并且可以任意切换。你把它安装在电脑上之后,只需要一条命令,就能把文本转成 MP3,全程无需打开浏览器,也无需手动点击任何界面。

另外,它支持标准输入,也就是说你可以把其他程序的输出直接丢给它。比如我写了一个脚本,每天从某个文本文件里读取当天要提醒的内容,自动生成一段语音文件,再通过定时任务播放,相当于完全自动化的“语音助手”。这些事情用 Balabolka 也能做,但没有命令行来得直接高效。

4.2 安装与最小可用示例,看一遍就能上手

安装 edge-tts 之前你需要确保电脑已经安装了 Python 3.8 或以上版本。然后在终端里执行:

pip install edge-tts

装好后,先查看一下支持哪些中文语音:

edge-tts --list-voices | grep zh-CN

你会看到一长串以 zh-CN 开头的语音角色,其中比较常用的是zh-CN-XiaoxiaoNeuralzh-CN-YunxiNeuralzh-CN-YunjianNeural等。想让“晓晓”帮你读一句话,可以这样:

edge-tts --voice zh-CN-XiaoxiaoNeural --text "你好,这是一段测试语音。" --write-media hello.mp3

执行完,当前目录下就会生成一个 hello.mp3 文件。如果你有一段更长的文字,可以先把文字保存在content.txt里,然后执行:

edge-tts --voice zh-CN-XiaoxiaoNeural -f content.txt --write-media output.mp3

注意这里的参数是-f后面跟文件名,而不是--text。这个细节我第一次用就踩了坑,查帮助文档才反应过来。如果你需要同时生成字幕文件,还可以加一个参数:

edge-tts --voice zh-CN-XiaoxiaoNeural -f content.txt --write-media output.mp3 --write-subtitles output.vtt

生成出来的 VTT 字幕文件非常适合做视频字幕,能省掉很多手动对轴的时间。

4.3 结合模拟器与陪伴类应用:把生成好的语音“喂”给其他程序

最近很多人折腾雷电模拟器里的文字转语音(TTS)输出,其实就是想给各种陪伴类应用或者语音助手配上更自然的声音。但模拟器自带的 TTS 引擎往往音质一般,而且可定制性差。我建议的做法是,在电脑上用 edge-tts 把对话文本提前生成好音频文件,然后通过模拟器的共享文件夹把音频导入,再在应用里设置为提示音或播放素材。

这个流程虽然多了一步,但胜在稳定。模拟器里的 TTS 引擎可能会因为系统权限、网络策略等各种原因抽风,而自己生成的 MP3 文件只要丢进去播放,就不会再有这些幺蛾子。比如你想给某个陪伴类小工具做一个“早安问候”的音频,直接把文本交给 edge-tts,生成一个带情感的语音包,放到模拟器共享目录里,效果比原版机械音好太多。

如果你的需求更进一步,想直接在软件层面调用 edge-tts,可以写一点 Python 代码:

import asyncio import edge_tts async def generate(): tts = edge_tts.Communicate("今天天气不错,一起出去走走吧。", "zh-CN-XiaoxiaoNeural") await tts.save("greeting.mp3") asyncio.run(generate())

这段代码运行后同样会得到一份语音文件。以后只要把文本换成变量,放在循环里,就能批量生成大量音频素材。我甚至用它给一些测试工具做过自动语音播报,非常省事。

5. 三款工具横向对比与实战场景推荐

工具没有绝对的好坏,只有适不适合当前任务。这一节我把三款工具的直观数据进行对比,方便你结合自己的需求快速锁定目标。

5.1 一张表看懂差异:平台、音质、导出、价格

对比维度Edge 大声朗读Balabolkaedge-tts
平台Windows / macOS / Android / iOSWindowsWindows / macOS / Linux
是否需要安装无需,浏览器自带需要安装软件需要 Python 环境
是否依赖网络需要联网获取语音完全离线可用需要联网调用接口
中文语音质量优秀(神经网络语音)看系统语音包,可优秀优秀(同微软神经网络语音)
支持文本格式网页 / PDF 为主大量文本和电子书格式任意包含文字的文本文件
导出音频不支持直接导出支持 MP3 / WAV / OGG 等支持 MP3 / VTT 字幕
批量处理不支持支持,非常强支持,需脚本配合
免费商用需确认微软服务条款软件免费,语音包有不同的使用条款接口非官方,商用需谨慎
上手难度极低低到中等中等,需懂命令行

这张表可以看出一个大致规律:如果你要的是“省心”,选 Edge;如果追求“离线可控”,选 Balabolka;如果想要“自动化和批量”,选 edge-tts。三者并不是互相排斥的关系,很多人包括我,都是混合使用的。

5.2 不同需求的选择建议:直接抄作业

我按最常见的五类需求给出参考组合,你可以直接照着选。

第一类,只想让浏览器里的文章读出来,不想安装任何东西,那就用 Edge 的大声朗读。第二类,手里有大量 txt 或 epub 小说,想转成有声书存到手机里,选 Balabolka,提前装好自然语音包,批量导出 MP3。第三类,做短视频、做配音,语音需要反复调整且可能成批处理,优先用 edge-tts,配合脚本能很快生成一堆音频素材。第四类,在安卓模拟器里给陪伴类应用扩展语音能力,直接把 edge-tts 生成好的音频文件导入模拟器播放,是最稳妥的路线。第五类,需要离线工作环境,那就老老实实装 Balabolka,网断也不影响产出。

如果你实在不知道选哪个,我建议从 Edge 开始体验,确认自己对“自然语音”的接受度;觉得满意了,再尝试用 Balabolka 做批量导出;等到熟悉了文件、格式这些基础概念,再上手 edge-tts。这条路对新手最友好,不会一上来就被命令行劝退。

6. 常见问题与排查技巧实录

最后这部分是我在实际使用中积累下来的问题清单。很多问题你百度可能都搜不到准确答案,但按下面这些思路排查,基本都能解决。

6.1 “声音不对 / 没有声音”排查清单

如果你使用 Balabolka 时发现“语音列表是空的”,先检查系统里是不是没有任何语音包。Windows 10/11 在首次设置时通常不会自动安装中文语音,需要手动到“设置 -> 时间和语言 -> 语音”里添加。添加后别忘了一定要重启软件,否则列表不会刷新。

如果你用 edge-tts 时出现“无法连接到服务”或“请求超时”,第一反应应该是检查网络状态。这个工具依赖微软在线接口,网络不稳或者公司内网限制可能导致请求失败。遇到这种情况,过几分钟重试,或者换一个网络环境试试。注意,这个接口是非官方项目,接口策略随时可能调整,如果你发现某一天突然不能用了,不用太惊讶,可以暂时切回 Balabolka。

如果你用 Edge 朗读时没有声音,多半是系统默认音频设备的问题。打开系统“音量合成器”,确认浏览器没有被静音;或者在 Edge 设置里检查“大声朗读默认语音”是否选择了正确的语音数据文件。

6.2 批量生成慢 / 文件过大怎么办

Balabolka 转长文本时速度慢,很多时候是因为你选择的语音引擎是神经网络模型,这类模型计算量大,属于正常情况。想提速可以尝试降低音频采样率,比如输出 22050Hz 而不是默认的 44100Hz,人耳听感差别很小,但转换速度能快不少。另外,尽量不要同时开太多其他占 CPU 的程序。

edge-tts 生成中等长度文本时速度很快,但如果你直接把一本几十万字的书塞进-f参数,可能会因为请求内容太大而报错。建议先用脚本按章节或固定字数拆分文本,生成多个小音频文件,再使用 ffmpeg 合并。这样做还有一个额外好处:出错了只需要重新生成出错的那一小段,不用从头再来。

6.3 小心版权和商用红线,别等发了视频才后悔

文字转语音工具生成的音频能不能商用,这个问题没有统一答案。Balabolka 软件本身免费,但语音包的使用条款各不相同,尤其是一些第三方“破解语音包”,风险更高。我个人的建议是:自用随便折腾,但如果要发布到带收益的平台,最好的办法是选择明确允许商用的服务,或者联系版权方确认。

对于 edge-tts,因为它调用的是非官方接口,免费归免费,但稳定性没有保证,用的时候要有“可能随时失效”的心态。如果项目对音频质量要求极高、且对版权敏感,花钱购买正规的 TTS 服务才是最稳妥的路子。免费小工具解决的是 90% 的日常需求,剩下 10% 的商业需求还是别省这笔钱。

我个人在实际操作中的体会是:这三款工具根本不冲突,反而像是一套组合拳。遇到不确定的文本,我优先用 Edge 试听;确定要保存成音频,就交给 Balabolka 批量处理;想给某个项目做自动配音,就直接上 edge-tts。最后再分享一个小技巧:无论你用哪一款,都先转换一小段文字试听,确认语速、音色、格式都满意了,再跑全量文件。别问我是怎么知道的——我曾经直接用默认设置跑完一本五十万字的小说,结果发现整本都没选对理想的语音角色,那种想砸电脑的滋味,你懂的。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询