1158+ 语言 AI 有声书工厂:把 Calibre 里的电子书变成音频的实战教程
2026/9/7 1:35:12 网站建设 项目流程

1158+ 语言 AI 有声书工厂:把 Calibre 里的电子书变成音频的实战教程

【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook

你的 Calibre 书库里是不是也堆满了 EPUB,其中大半却从未被"听"过?ebook2audiobook(E2A)是一款开源的电子书转语音 AI 语音合成工具:丢进一本电子书,产出带完整章节和元数据的 AI 有声书,支持 1158+ 种语言和声音克隆。

读完这篇,你会拿到:

  • 3 步出第一本可播放有声书的操作路径
  • Windows / macOS / Linux 各自合适的部署方式
  • 语音克隆与多语言引擎的挑选方法
  • 官方 FAQ 里点名的 4 个坑及解法

输入选项界面:电子书、声音样本、语言、计算单元一页配齐

能力总览

先看几组硬数据,心里有底再动手:

  • 语言数 1158+:28 种主流语言 + 1130 余种小语种
  • 20+ 输入格式:epub、mobi、azw3、pdf、txt、rtf、html、docx 等
  • 10 种输出格式:m4b、mp3、flac、wav、ogg、aac 等,单声道或立体声
  • 9 个 TTS 引擎:XTTSv2、Bark、Fairseq、VITS、Tacotron2、Piper 等
  • 声音克隆:一段 1~5 分钟样本即可,背景噪音自动清理
  • 章节与元数据保留,SML 标签可微调停顿与说话人
  • 准入门槛:2GB 内存 / 1GB 显存即可跑

扫描件、纯图片的 PDF 也有内置 OCR 兜底。很多人把它叫 Calibre 有声书插件——严格说它是独立工具,不用装进 Calibre,从书库导出 EPUB 直接开工。

🚀 快速上手:3 步出第一本有声书

第 1 步,拿代码。把仓库克隆到任意目录并进入:

git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook

第 2 步,启动。Linux / macOS 执行./ebook2audiobook.command,Windows 双击ebook2audiobook.cmd。首次运行会自动补齐依赖:macOS 走 Homebrew,Windows 走 scoop,不需要管理员权限。

第 3 步,转换。终端会打印localhost:7860地址,浏览器打开,把 EPUB 拖进去,选语言和声音,点转换即可。用 Calibre 管书的话,导出 EPUB 丢进来就行。

三种部署方式任选

同一套代码,三种用法,按你的场景挑:

方式适合谁平台要点
轻量无头模式脚本党、批量任务命令行加--headless,一行指定电子书、语言、声音;Linux/macOS 用.command,Windows 用.cmd
原生 GUI 模式绝大多数用户双击启动,浏览器进 Web 界面;Windows 由 scoop 自动装依赖,macOS 由 Homebrew 兜底
容器化 Docker环境复杂、想干净隔离镜像完全自包含,告别依赖折腾;Windows 需开启虚拟化;Docker 内 Apple Silicon 按 CPU 跑

不想占用本机?仓库自带 Google Colab 与 Kaggle 笔记本(见 Notebooks/),远程免费 GPU 上跑完整流程。

🔊 进阶玩法:声音克隆 × 多语言引擎

克隆自己的声音:上传一段 1~5 分钟的音频即可。录音环境吵也没关系,E2A 会自动降噪。想更进一步,可以用内置的 components/Universal_TTS_Finetune 微调自己的 XTTSv2 模型,再以自定义模型加载。

引擎怎么选,直接抄表:

目标语言推荐引擎特点
中文、英语XTTSv2自然流畅,支持零样本声音克隆
法语、德语、西语等主流语XTTSv2 / BarkBark 表现力更强,情绪起伏足
1130+ 小语种Fairseq覆盖广度是它的看家本领
纯 CPU 低配机YourTTS / Tacotron2CPU 友好,官方提示音色偏"Siri 级"

完整语言清单见 README.md 的 Supported Languages 一节。

转换完成后在线试听,并下载 m4b 文件

速度与硬件:逼近实时怎么做到

官方口径:CPU 明显偏慢,GPU 可以做到接近实时的转换。所以耗时大头不在"哪台机器",而在算力单元和引擎的搭配:

硬件档位速度体验推荐引擎
基础 CPU(2GB 内存)慢,适合轻量任务YourTTS、Tacotron2
中端 GPU(1GB 显存起步,4GB 更稳)VITS、Fairseq、XTTSv2
高端 GPU(CUDA / ROCm / XPU)接近实时XTTSv2 + 声音克隆

三条调优建议:

  1. CPU 就换轻引擎——现代引擎在 CPU 上"非常慢",YourTTS / Tacotron2 是官方点名方案
  2. 整柜一次转完——无头模式支持--ebooks_dir批量目录转换与多进程转换
  3. 用 SML 标签精修节奏——[break][pause:N][voice:...]精确控制停顿与换声,改一句不用重转全书

Audio Generation Preferences 页:用滑块调创造力、语速、重复惩罚

故障速查

现象怎么办
GPU 没被识别核对驱动与计算框架版本,按官方 GPU Issues Wiki 自查
CPU 转换太慢换低负载引擎或改用 GPU;顺带检查参数是否合理
手动装依赖反复失败别折腾了,Docker 镜像自包含且支持无头模式,命令末尾加--help看全部选项
音频在句中被截断已知痛点,直接提 issue,官方正按语言逐步优化断句逻辑

输出格式、声道等默认值在 lib/conf.py 里,改前建议先备份一份。

现在就开始

路线图已经排上:按句级精确编辑文本、iOS / Android 客户端、接入更多新引擎,Audiobookshelf 书库集成也已可用。与其收藏吃灰,不如今晚就从 Calibre 书库里导一本 EPUB,让 E2A 先读给你听。

💡 顺手收藏这篇,项目更新很快,新声音、新引擎会持续落地。

【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询