1158+ 语言 AI 有声书工厂:把 Calibre 里的电子书变成音频的实战教程
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
你的 Calibre 书库里是不是也堆满了 EPUB,其中大半却从未被"听"过?ebook2audiobook(E2A)是一款开源的电子书转语音 AI 语音合成工具:丢进一本电子书,产出带完整章节和元数据的 AI 有声书,支持 1158+ 种语言和声音克隆。
读完这篇,你会拿到:
- 3 步出第一本可播放有声书的操作路径
- Windows / macOS / Linux 各自合适的部署方式
- 语音克隆与多语言引擎的挑选方法
- 官方 FAQ 里点名的 4 个坑及解法
输入选项界面:电子书、声音样本、语言、计算单元一页配齐
能力总览
先看几组硬数据,心里有底再动手:
- 语言数 1158+:28 种主流语言 + 1130 余种小语种
- 20+ 输入格式:epub、mobi、azw3、pdf、txt、rtf、html、docx 等
- 10 种输出格式:m4b、mp3、flac、wav、ogg、aac 等,单声道或立体声
- 9 个 TTS 引擎:XTTSv2、Bark、Fairseq、VITS、Tacotron2、Piper 等
- 声音克隆:一段 1~5 分钟样本即可,背景噪音自动清理
- 章节与元数据保留,SML 标签可微调停顿与说话人
- 准入门槛:2GB 内存 / 1GB 显存即可跑
扫描件、纯图片的 PDF 也有内置 OCR 兜底。很多人把它叫 Calibre 有声书插件——严格说它是独立工具,不用装进 Calibre,从书库导出 EPUB 直接开工。
🚀 快速上手:3 步出第一本有声书
第 1 步,拿代码。把仓库克隆到任意目录并进入:
git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook第 2 步,启动。Linux / macOS 执行./ebook2audiobook.command,Windows 双击ebook2audiobook.cmd。首次运行会自动补齐依赖:macOS 走 Homebrew,Windows 走 scoop,不需要管理员权限。
第 3 步,转换。终端会打印localhost:7860地址,浏览器打开,把 EPUB 拖进去,选语言和声音,点转换即可。用 Calibre 管书的话,导出 EPUB 丢进来就行。
三种部署方式任选
同一套代码,三种用法,按你的场景挑:
| 方式 | 适合谁 | 平台要点 |
|---|---|---|
| 轻量无头模式 | 脚本党、批量任务 | 命令行加--headless,一行指定电子书、语言、声音;Linux/macOS 用.command,Windows 用.cmd |
| 原生 GUI 模式 | 绝大多数用户 | 双击启动,浏览器进 Web 界面;Windows 由 scoop 自动装依赖,macOS 由 Homebrew 兜底 |
| 容器化 Docker | 环境复杂、想干净隔离 | 镜像完全自包含,告别依赖折腾;Windows 需开启虚拟化;Docker 内 Apple Silicon 按 CPU 跑 |
不想占用本机?仓库自带 Google Colab 与 Kaggle 笔记本(见 Notebooks/),远程免费 GPU 上跑完整流程。
🔊 进阶玩法:声音克隆 × 多语言引擎
克隆自己的声音:上传一段 1~5 分钟的音频即可。录音环境吵也没关系,E2A 会自动降噪。想更进一步,可以用内置的 components/Universal_TTS_Finetune 微调自己的 XTTSv2 模型,再以自定义模型加载。
引擎怎么选,直接抄表:
| 目标语言 | 推荐引擎 | 特点 |
|---|---|---|
| 中文、英语 | XTTSv2 | 自然流畅,支持零样本声音克隆 |
| 法语、德语、西语等主流语 | XTTSv2 / Bark | Bark 表现力更强,情绪起伏足 |
| 1130+ 小语种 | Fairseq | 覆盖广度是它的看家本领 |
| 纯 CPU 低配机 | YourTTS / Tacotron2 | CPU 友好,官方提示音色偏"Siri 级" |
完整语言清单见 README.md 的 Supported Languages 一节。
转换完成后在线试听,并下载 m4b 文件
速度与硬件:逼近实时怎么做到
官方口径:CPU 明显偏慢,GPU 可以做到接近实时的转换。所以耗时大头不在"哪台机器",而在算力单元和引擎的搭配:
| 硬件档位 | 速度体验 | 推荐引擎 |
|---|---|---|
| 基础 CPU(2GB 内存) | 慢,适合轻量任务 | YourTTS、Tacotron2 |
| 中端 GPU(1GB 显存起步,4GB 更稳) | 快 | VITS、Fairseq、XTTSv2 |
| 高端 GPU(CUDA / ROCm / XPU) | 接近实时 | XTTSv2 + 声音克隆 |
三条调优建议:
- CPU 就换轻引擎——现代引擎在 CPU 上"非常慢",YourTTS / Tacotron2 是官方点名方案
- 整柜一次转完——无头模式支持
--ebooks_dir批量目录转换与多进程转换 - 用 SML 标签精修节奏——
[break]、[pause:N]、[voice:...]精确控制停顿与换声,改一句不用重转全书
Audio Generation Preferences 页:用滑块调创造力、语速、重复惩罚
故障速查
| 现象 | 怎么办 |
|---|---|
| GPU 没被识别 | 核对驱动与计算框架版本,按官方 GPU Issues Wiki 自查 |
| CPU 转换太慢 | 换低负载引擎或改用 GPU;顺带检查参数是否合理 |
| 手动装依赖反复失败 | 别折腾了,Docker 镜像自包含且支持无头模式,命令末尾加--help看全部选项 |
| 音频在句中被截断 | 已知痛点,直接提 issue,官方正按语言逐步优化断句逻辑 |
输出格式、声道等默认值在 lib/conf.py 里,改前建议先备份一份。
现在就开始
路线图已经排上:按句级精确编辑文本、iOS / Android 客户端、接入更多新引擎,Audiobookshelf 书库集成也已可用。与其收藏吃灰,不如今晚就从 Calibre 书库里导一本 EPUB,让 E2A 先读给你听。
💡 顺手收藏这篇,项目更新很快,新声音、新引擎会持续落地。
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考