5分钟上手:把EPUB变成有声书的语音克隆指南
2026/9/7 19:09:04 网站建设 项目流程

5分钟上手:把EPUB变成有声书的语音克隆指南

【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook

你可能遇到过这种情况

电子书阅读器里躺着一堆 EPUB,可通勤、锻炼的时间翻不动书,市售有声书又覆盖不全你想读的书。ebook2audiobook(下文简称 E2A)就是为这个需求做的:它把电子书通过语音合成(也就是把文字变成音频)生成带章节结构的有声书,并支持语音克隆和 1158 种语言。

🚀 跑起来:3步完成首次转换

最快路径是本地 Web 界面,一共 3 步。

  1. 获取项目:
git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook
  1. 运行启动脚本:macOS/Linux 在终端执行./ebook2audiobook.command,Windows 双击ebook2audiobook.cmd。脚本会自动安装运行环境,你不用手动配 Python 依赖。
  2. 浏览器会自动打开 http://localhost:7860 界面,上传一本电子书、点 Convert,第一次转换就完成了。

如果安装报错或页面打不开,可以直接跳到文末 FAQ 查对应解法。

它能做什么

跑起来之后,再看几个真正拉开差距的能力。

语音克隆

上传一段简短清晰的录音,合成出的声音就会接近这个人。比如录 1 分钟自己朗读的音频,之后整本书都可以用你的声音来读;录音里有背景音乐或噪音也没关系,E2A 会自动清理。

OCR 文本识别

扫描版 PDF 或整页是图片的书,文字复制不出来,内置 OCR 能直接从图片里识别出文字再合成语音。

上图是一张扫描书页,E2A 识别其中的英文文字后可以整页转成音频。

SML 标签控制

SML 是 E2A 内置的简单标记语言,用来精细控制停顿和换声:[break]表示 0.3–0.6 秒短停顿,[pause:3]表示固定 3 秒停顿,[voice:/路径/voice.wav]...[/voice]可以在朗读中途切换到另一个声音。

批量转换

多本书一次转完,用命令行模式直接转换整个目录:

./ebook2audiobook.command --headless --ebooks_dir ./my_books --language eng

--language使用三位语言码,比如 eng 是英语、fra 是法语;Windows 下把脚本名换成ebook2audiobook.cmd即可。

界面与操作流程

界面就两个标签页:"Input Options" 和 "Audio Generation Preferences",按顺序操作 3 步即可。

第一张图里,把 EPUB 拖进左上角 "EBook File" 区域,在 "Processor Unit" 选 CPU 或 GPU,"Language" 下拉框确认书籍语言,默认 English 不用改;想做语音克隆就在右侧 "Cloning Voice" 上传语音文件。

第二张图是参数滑杆:Temperature(创造性)、Speed(语速)、Repetition Penalty(重复惩罚)等。全部保持默认就能跑,不用逐项研究,等听到效果"不对劲"再回来调。

第三张图里,点 Convert 转换完成后,先在 "Listen" 播放器里试听,再从下方 "Download" 区下载 m4b 文件。m4b 格式支持章节标记,适合在播放器里按章收听长书。

调优指南

如果第一次转换的结果你听着可以接受,默认值就够了;想让声音更自然,重点看这几个参数:

参数作用推荐值适用场景
Temperature(温度)语音创造性,越高越活泼0.7–0.9叙事 0.7 左右,对白多可到 1.0
Repetition Penalty(重复惩罚)抑制同一短语反复出现2.0–2.5文本里重复词句较多时
Speed(语速)朗读快慢0.8–1.01.0 自然,0.8 更舒缓
Top-k选词范围,越低越稳定50降低可加快生成速度
Text Splitting(文本分割)长文本切段再合成开启长篇小说建议必开

经验之谈:叙事类内容温度调到 0.7–0.8 最自然;嫌快嫌慢只动 Speed 一项,别同时改多个参数,不好定位问题。

部署与硬件

硬件要求不高:最低2GB 内存、1GB 显存,推荐8GB 内存、4GB 显存。项目支持 Windows、macOS、Linux 三大系统,包括 Apple Silicon 和 ARM 架构。不想折腾本地环境的话,有现成的 Docker 镜像,用DEVICE_TAG=cu128 docker compose --profile gpu up就能拉起 GPU 版。

适合谁用

适合想在通勤和运动时间听书的人、给视障朋友做阅读辅助的人、需要给播客或视频配旁白的人。

常见问题

Q:GPU 没被检测到怎么办?A:先用 CPU 模式跑通整个流程,再检查显卡驱动和 CUDA 版本;依赖问题太麻烦时直接改用 Docker 镜像。

Q:CPU 模式转换太慢怎么办?A:CPU 跑高品质引擎确实慢,改用 YourTTS、Tacotron2 这类轻量引擎提速,或者切到 GPU 模式。

Q:语音克隆样本带噪音怎么办?A:直接上传即可,E2A 会自动去除背景噪音再提取声音特征,不需要你提前做降噪。

Q:EPUB 里不想要的前言、注释被读出来了怎么办?A:EPUB 没有统一的章节结构标准,转换前用编辑器手动删掉不需要的段落。

开始你的第一次转换

打开浏览器访问 http://localhost:7860 就能开始第一次转换。完整参数说明和格式列表见项目内的这几份文件:

  • README.md:安装、使用与故障排查
  • lib/conf.py:默认输出格式、设备与路径设置
  • lib/conf_models.py:支持的语音合成引擎与模型列表

【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询