PDFMathTranslate 使用指南:一条命令翻译英文 PDF,公式和排版完整保留
【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate
英文论文想翻成中文,最怕公式变乱码、双栏变单栏。PDFMathTranslate(pdf2zh)就是干这个的:把 PDF 全文译成中文,公式、图表、双栏结构原样保留,还会同时生成纯译文和中英对照两个版本,适合啃文献的学生和研究员。
效果先给你看
输入一篇英文 Nature 论文,输出长这样:
翻译完成后,版面结构和原文逐行对应,连页眉页脚都没跑位:
下面的动画演示了它在翻译时如何处理跨栏文本:
最小路径跑通
- 准备 Python 3.11 或 3.12 环境。
- 安装:
pip install pdf2zh - 翻译:
pdf2zh document.pdf- 完事。当前目录会多出
document-mono.pdf(纯译文)和document-dual.pdf(中英对照)。
全程不用配密钥,默认走 Google 翻译服务。
按需加料
用顺手之后,这几个参数出场率最高:
-s:换翻译服务,如pdf2zh paper.pdf -s deepl或-s openai:gpt-4o-mini(对应服务的密钥需先设成环境变量)。-p:只翻指定页码,pdf2zh paper.pdf -p 1就翻第 1 页。-li/-lo:指定源语言和目标语言,如-li en -lo zh。-t:并发线程数,大文档可以调大提速。--dir:整个文件夹批量翻译,配合-o指定输出目录,文献多的时候直接pdf2zh --dir ./papers/ -o results/。--ignore-cache:强制重新翻译,不走缓存。
完整参数清单在 docs/ADVANCED.md,包括用--prompt自定义 LLM 提示词、--config加载 JSON 配置这些玩法。
换一种姿势
不想碰命令行的话,装完直接开图形界面:
pdf2zh -i浏览器打开http://localhost:7860/,拖文件进去、选服务、点翻译就行,详情见 docs/README_GUI.md:
懒得装 Python 环境就用 Docker,拉镜像映射 7860 端口,同样打开浏览器用:
docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zhWindows 用户还有 release 页的免安装 exe,下载解压双击就能跑。
这些情况先绕开
- 扫描件翻不了。它解析的是 PDF 里的文本层,纯图片扫描件先过一遍 OCR 再喂进来。
- Python 版本卡死。只支持 3.11~3.12,3.10 和 3.13 都装不上。
- 首次运行模型下载慢。要拉取
wybxc/DocLayout-YOLO-DocStructBench-onnx版面检测模型,网络受限时设个镜像环境变量:set HF_ENDPOINT=https://hf-mirror.com。
另外,Ollama、OpenAI 这类服务的密钥要先设好环境变量,各服务对应的变量名在 docs/ADVANCED.md 的表格里查得到。
收尾
📚 PDFMathTranslate 把"翻 PDF 还保住排版"压缩成了一条命令的事,而且被 EMNLP 2025 收录。装完翻一篇论文感受一下,参数细节翻 docs/ADVANCED.md 就够。
pip install pdf2zh【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考