免费本地语音合成指南:Windows 三步出音频
【免费下载链接】ChatTTS-ui一个简单的本地网页界面,使用ChatTTS将文字合成为语音,同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui
给一条视频配个音,得先注册云语音服务的账号,按字符计费,还得担心文案内容被第三方留存。ChatTTS-ui 是一个开源的本地语音合成工具,把 ChatTTS 模型跑在你自己的电脑上,文字转成语音,不经过网络,也没有按次计费。
它是做什么的
一句话:本地网页版的文字转语音界面。卖点有三个:
- 全程离线,文本和音频都留在你的设备里
- 不按次收费,部署好之后一直免费用
- 最低 4GB 内存即可运行,CPU、GPU 两种模式都支持
三步完成部署(Windows 一键部署)
你是 Windows 用户的话,预打包版本是最快的路线:
- 下载预编译版本,解压
- 双击
app.exe启动,首次运行会自动下载约 2GB 的模型文件,耐心等它下完 - 浏览器自动打开后,就可以开始生成语音了
如果安全软件对这个 exe 报警,别硬来,换源码路线就行。服务器场景可以用两套 Docker 编排文件(docker-compose.gpu.yaml、docker-compose.cpu.yaml)拉起容器,访问 9966 端口;开发者也可以自建 venv 虚拟环境,执行pip install -r requirements.txt后运行 app.py 启动。
🎙 从文字到成品的四个步骤
操作顺序是固定的:输入 → 选音色 → 生成 → 微调。
1. 输入文本。中英文、数字可以混着写,标点和数字会被模型智能处理,不用你预先清洗。
2. 选音色。下拉列表里挑一个预设音色就行,音色文件都放在 speaker/ 目录。预设都不合心意时,在高级选项里填一个custom_voice种子值:同一个种子能复现同一音色,新生成的音色也会存进 speaker 目录,下次直接复用。
3. 生成语音。点一下按钮,稍等片刻音频出来,试听不满意就换个参数再来。
4. 用情感标签微调。这是最出效果的一环,在文字里加几个控制词:
[laugh_0]插入笑声[break_2]停顿 2 秒[emph_1]强调语气[oral_2]口语化表达
三个典型场景
- 自媒体配音:把脚本批量转成音频,丢进剪辑软件对轨,一个人完成配音
- 视障朗读:长文转语音,配合音色和停顿调整,收听体验更舒服
- 教师课件:把知识点转成音频,学生通勤路上也能听
❓ 常见问题速查与调优三招
下面这几条是高频坑,按顺序排查一遍:
- 模型下载失败:先检查网络连接;还不行就手动下载模型包,解压到 asset 目录
- GPU 不生效:核对 CUDA(11.8+)与 PyTorch 的版本兼容性,不匹配就卸载重装 GPU 版 PyTorch
- 中文显示乱码:确认系统编码是 UTF-8,顺便检查浏览器语言设置
- 合成速度不够快:装 CUDA 11.8+,速度能提 3-5 倍
- 长文本容易出错:按 50 字以内拆段,逐段合成
- 第二次启动慢:首次运行后模型已缓存在本地,之后不会再重复下载
完整的报错对照表见 faq.md,底层模型代码在 ChatTTS/ 目录里。
写在最后
如果你要一个不联网、不按次计费、没有技术门槛的语音生成工具,ChatTTS-ui 已经是现成的答案:解压、双击,三步拿到第一段音频。现在就去下载 Windows 包,输入一句话,听听它的表现。
【免费下载链接】ChatTTS-ui一个简单的本地网页界面,使用ChatTTS将文字合成为语音,同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考