5分钟上手:把EPUB变成有声书的语音克隆指南
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
你可能遇到过这种情况
电子书阅读器里躺着一堆 EPUB,可通勤、锻炼的时间翻不动书,市售有声书又覆盖不全你想读的书。ebook2audiobook(下文简称 E2A)就是为这个需求做的:它把电子书通过语音合成(也就是把文字变成音频)生成带章节结构的有声书,并支持语音克隆和 1158 种语言。
🚀 跑起来:3步完成首次转换
最快路径是本地 Web 界面,一共 3 步。
- 获取项目:
git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook- 运行启动脚本:macOS/Linux 在终端执行
./ebook2audiobook.command,Windows 双击ebook2audiobook.cmd。脚本会自动安装运行环境,你不用手动配 Python 依赖。 - 浏览器会自动打开 http://localhost:7860 界面,上传一本电子书、点 Convert,第一次转换就完成了。
如果安装报错或页面打不开,可以直接跳到文末 FAQ 查对应解法。
它能做什么
跑起来之后,再看几个真正拉开差距的能力。
语音克隆
上传一段简短清晰的录音,合成出的声音就会接近这个人。比如录 1 分钟自己朗读的音频,之后整本书都可以用你的声音来读;录音里有背景音乐或噪音也没关系,E2A 会自动清理。
OCR 文本识别
扫描版 PDF 或整页是图片的书,文字复制不出来,内置 OCR 能直接从图片里识别出文字再合成语音。
上图是一张扫描书页,E2A 识别其中的英文文字后可以整页转成音频。
SML 标签控制
SML 是 E2A 内置的简单标记语言,用来精细控制停顿和换声:[break]表示 0.3–0.6 秒短停顿,[pause:3]表示固定 3 秒停顿,[voice:/路径/voice.wav]...[/voice]可以在朗读中途切换到另一个声音。
批量转换
多本书一次转完,用命令行模式直接转换整个目录:
./ebook2audiobook.command --headless --ebooks_dir ./my_books --language eng--language使用三位语言码,比如 eng 是英语、fra 是法语;Windows 下把脚本名换成ebook2audiobook.cmd即可。
界面与操作流程
界面就两个标签页:"Input Options" 和 "Audio Generation Preferences",按顺序操作 3 步即可。
第一张图里,把 EPUB 拖进左上角 "EBook File" 区域,在 "Processor Unit" 选 CPU 或 GPU,"Language" 下拉框确认书籍语言,默认 English 不用改;想做语音克隆就在右侧 "Cloning Voice" 上传语音文件。
第二张图是参数滑杆:Temperature(创造性)、Speed(语速)、Repetition Penalty(重复惩罚)等。全部保持默认就能跑,不用逐项研究,等听到效果"不对劲"再回来调。
第三张图里,点 Convert 转换完成后,先在 "Listen" 播放器里试听,再从下方 "Download" 区下载 m4b 文件。m4b 格式支持章节标记,适合在播放器里按章收听长书。
调优指南
如果第一次转换的结果你听着可以接受,默认值就够了;想让声音更自然,重点看这几个参数:
| 参数 | 作用 | 推荐值 | 适用场景 |
|---|---|---|---|
| Temperature(温度) | 语音创造性,越高越活泼 | 0.7–0.9 | 叙事 0.7 左右,对白多可到 1.0 |
| Repetition Penalty(重复惩罚) | 抑制同一短语反复出现 | 2.0–2.5 | 文本里重复词句较多时 |
| Speed(语速) | 朗读快慢 | 0.8–1.0 | 1.0 自然,0.8 更舒缓 |
| Top-k | 选词范围,越低越稳定 | 50 | 降低可加快生成速度 |
| Text Splitting(文本分割) | 长文本切段再合成 | 开启 | 长篇小说建议必开 |
经验之谈:叙事类内容温度调到 0.7–0.8 最自然;嫌快嫌慢只动 Speed 一项,别同时改多个参数,不好定位问题。
部署与硬件
硬件要求不高:最低2GB 内存、1GB 显存,推荐8GB 内存、4GB 显存。项目支持 Windows、macOS、Linux 三大系统,包括 Apple Silicon 和 ARM 架构。不想折腾本地环境的话,有现成的 Docker 镜像,用DEVICE_TAG=cu128 docker compose --profile gpu up就能拉起 GPU 版。
适合谁用
适合想在通勤和运动时间听书的人、给视障朋友做阅读辅助的人、需要给播客或视频配旁白的人。
常见问题
Q:GPU 没被检测到怎么办?A:先用 CPU 模式跑通整个流程,再检查显卡驱动和 CUDA 版本;依赖问题太麻烦时直接改用 Docker 镜像。
Q:CPU 模式转换太慢怎么办?A:CPU 跑高品质引擎确实慢,改用 YourTTS、Tacotron2 这类轻量引擎提速,或者切到 GPU 模式。
Q:语音克隆样本带噪音怎么办?A:直接上传即可,E2A 会自动去除背景噪音再提取声音特征,不需要你提前做降噪。
Q:EPUB 里不想要的前言、注释被读出来了怎么办?A:EPUB 没有统一的章节结构标准,转换前用编辑器手动删掉不需要的段落。
开始你的第一次转换
打开浏览器访问 http://localhost:7860 就能开始第一次转换。完整参数说明和格式列表见项目内的这几份文件:
- README.md:安装、使用与故障排查
- lib/conf.py:默认输出格式、设备与路径设置
- lib/conf_models.py:支持的语音合成引擎与模型列表
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考