BabelDOC:不写代码的PDF翻译与双语对照
【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC
📄 英文论文一翻译,表格和公式就全乱?
你一定遇到过这种情况:拿到一份几十页的英文论文,丢给翻译软件,结果表格被打散、公式乱飞、排版面目全非。BabelDOC 就是冲着这类文档来的——一个能把公式、表格都照顾到的 PDF 翻译工具,翻完还会生成原文和译文并排的双语对照版。
👀 一张图看懂它翻译出来的样子
看这张图:左边是原文页面,右边是翻译后的页面。像f(x)=3x+1这样的公式,两边都原样保留。也就是说,它不是把文字抽出来给你一堆乱序译文,而是让排版留在原来的位置。
🛠 它到底能帮你干哪几件事
- 把译文贴回原文排版的位置,公式、表格、图片不动
- 一次产出两个文件:中文单语版 + 双语对照版
- 自动识别扫描件,提前提醒你文档需要预处理
- 导入你自己的术语表,把专业词汇的译法锁死
- 大文档自动拆分再合并,不用你手动切章节
🚀 跟着做:从装好到拿到双语版
整个过程就三件事:装好它,喂给它一份 PDF,从输出里挑你要的版本。
先把工具装进电脑
官方推荐用uv装命令行工具,一条命令的事:
uv tool install --python 3.12 BabelDOC
装完就得到一个babeldoc命令,随时能翻。如果卡在这里:多半是缺 Python 3.12 或没装 uv,先补上再重试。
喂给它一份 PDF,挑好翻译通道
BabelDOC 靠 OpenAI 兼容的大模型做实际翻译,所以命令行里要带上接口地址和密钥:
babeldoc --files example.pdf --openai --openai-model gpt-4o-mini --openai-base-url 你的接口地址 --openai-api-key 你的密钥
源语言和目标语言默认就是英译中,一般不用动。如果卡在这里:首次运行会自动下载版面分析模型和字体,要花几分钟,别急着关窗口。
从输出里挑出你要的双语对照版
进度条跑完,当前目录(可用--output改到别处)会出现两个 PDF:一个是纯中文版,一个是双语对照版。
打开对照版,每页左原文、右译文,版式一一对应,逐段核对很方便。如果卡在这里:个别 PDF 阅读器显示乱码的话,加--enhance-compatibility重跑一次通常就好。
⚙️ 三个真正影响译文质量的设置
术语翻译前后不一致。准备一个 CSV 术语表,写清原词和期望译法(格式见 docs/example/demo_glossary.csv),再用--glossary-files传给 BabelDOC。模型翻译时会照着你的词条走,全文用词就统一了。
大文档跑得慢、还容易崩。命令里加--max-pages-per-part 50,它会按每份 50 页把文档拆成小块翻译,结束后自动合并回来。你不用手动分章节,内存压力也小很多。
扫描件的原文透出来,盖不住译文。命令里加--ocr-workaround,适合白底黑字的扫描件。它会在译文下方垫白色色块、把文字统一染黑,你看到的就只有干净的译文。
📚 想看内部原理,或卡住了怎么办
想搞懂它怎么解析 PDF、怎么排版,可以翻 docs/ImplementationDetails/,解析、排版、公式识别各有一篇讲原理的文章。真遇到问题,先去项目仓库的 Issue 区搜一下,大概率有人踩过同一个坑;搜不到就直接提一个。
桌面那份还没啃的英文论文,现在就可以扔给babeldoc试试,十几分钟后你手里会多一个看得下去的双语版。
【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考