ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

两条命令出双语版:免费 PDF 翻译完整保留公式和排版

两条命令出双语版:免费 PDF 翻译完整保留公式和排版 两条命令出双语版免费 PDF 翻译完整保留公式和排版【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate深夜赶 deadline你卡在一篇双栏英文论文上手动一页页翻排版散了公式也乱了。PDFMathTranslate 就是为这个场景做的——它只做一件事PDF 翻译并且完整保留原始排版。丢进英文原件当前目录会多出两个文件纯中文版和中英对照版公式、图表、目录原封不动。项目开源免费论文入选 EMNLP 2025 演示赛道。先睹为快左边是英文原页右边是翻译后的中文页。公式编号还在原来的位置双栏没有错位页眉页脚也都在。你拿到的还是那篇论文而不是重新流式排版的文档。装好它本机装好 Python 3.11 或 3.12然后一条命令pip install pdf2zh不想装 Python 也可以项目的发布页提供 Windows exe 包解压后双击就能跑。快速上手pdf2zh your_paper.pdf跑完当前目录多出两个文件your_paper-mono.pdf是纯中文版your_paper-dual.pdf是中英文对照版。两份都保留原稿的双栏排版、公式位置和插图摆放。默认引擎是 Google 翻译免费不用申请任何 Key。它为什么靠谱先认版面再翻译。工具先用版面检测模型DocLayout-YOLO识别原 PDF 的结构双栏在哪、页眉页脚在哪、图注在哪。翻译完成后中文回填到原始位置所以排版不会被重新流式打散。公式和变量名不被动。默认识别并保留 Math、Mono、Code、Italic、Symbol 等字体公式不会被翻译搅乱论文用了特殊字体时还能用-f参数加正则把它们也圈进保留范围。翻译引擎可插拔。Google、Bing、DeepL、OpenAI、Ollama 本地模型等数十种服务全部用-s参数切换不用改代码不想把论文内容传上云就用 Ollama 走本地模型。翻译缓存。翻过的文本会存进缓存同一份文档重复翻译直接命中不重复调用 API省钱也省时。多入口。除命令行外还有浏览器 Web 界面、Docker 容器和 MCP 服务器另提供 Python 与 HTTP API 方便开发者集成。实战用法整篇论文中英对照读。文件直接传进去命令和上面一样。跑完你拿到 mono纯中文和 dual对照两份文件公式、双栏、插图位置和原文一致可以直接用于精读和引用。先翻几页试效果。论文上百页不想整篇丢给翻译 API用-p参数只翻第 1 到 5 页pdf2zh paper.pdf -p 1-5产出依旧是两份文件但只处理 5 页试错快相同内容第二遍直接命中缓存。一条命令开 Web 界面。不想碰终端一条命令启动pdf2zh -i浏览器没自动打开就访问http://localhost:7860/。页面上上传论文、选择翻译服务和目标语言点 Translate完成后直接下载翻译后的 PDF。以这篇 Nature 论文为例翻译前翻译后标题、双栏正文和图注都变成中文版面和原文一致界面细节见 docs/README_GUI.md。想当团队服务用Docker 拉个镜像启动容器同样的界面。新手常问 ❓扫描版、图片型 PDF 能直接翻吗不建议。它的工作流是先把 PDF 里的文字提取出来再翻译扫描件是纯图片页没有文字层可提取需要先 OCR 成可编辑 PDF。项目带一个实验性的本地 OCR 功能简单白底扫描可以直接处理复杂扫描还是先自己转成可编辑 PDF 更稳。默认 Google 翻译想换 DeepL 怎么办加-s参数pdf2zh paper.pdf -s deepl。需要密钥的服务要先设置对应环境变量比如DEEPL_AUTH_KEY全部服务清单和变量名都在 docs/ADVANCED.md 里。第一次运行很慢或报错卡在哪首次运行会下载版面检测模型 DocLayout-YOLO网络受限时可能失败。先设置模型镜像环境变量Windows 用set HF_ENDPOINThttps://hf-mirror.comPowerShell 用$env:HF_ENDPOINT https://hf-mirror.com再重新运行即可。同一份文档重复翻译会不会重复计费不会。缓存默认开启翻过的文本直接命中想丢弃缓存全部重翻时加--ignore-cache参数。默认保留哪些字体Math、Mono、Code、Italic、Symbol 默认保留公式和变量名原样不动论文里还有别的特殊字体用-f追加正则即可。这些人的工具箱里该有它研究生 / 科研人员每天消化大量英文文献双语 PDF 让精读和引用更省力。工程师 / 技术写作者翻译外文规范、专利、白皮书原文排版保留方便对照。教师 / 培训讲师快速做出中英双语教学材料省去手工重排。开发者通过 Python / HTTP API 或 MCP 服务器把「保留排版的 PDF 翻译」嵌进自己的产品。安装就一条pip install pdf2zh把你的第一份 PDF 传进去当前目录就会多出第一份双语 PDF。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表