ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

PaddleOCR 文字识别与文档解析接入 AI 应用:安装配置完整指南

PaddleOCR 文字识别与文档解析接入 AI 应用:安装配置完整指南 PaddleOCR 文字识别与文档解析接入 AI 应用安装配置完整指南【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCRPaddleOCR 官方提供两个 Agent Skill把它们装进支持 Skills 的 AI 应用后你用一句话就能让应用完成图片文字识别和 PDF 文档解析成功标志是输出 JSON 中出现与源文件一致的rec_texts或markdownText。适用前提执行设备已装 Python 3.9且你的 AI 应用如 Claude Code、OpenClaw支持加载 Skills。第 1 步先选对工具需求推荐输出只要图片或 PDF 里的纯文本paddleocr-text-recognition行级文本 边界框 置信度分数要保留标题、表格、公式、多栏等文档结构paddleocr-doc-parsingMarkdown / 结构化结果判断标准一句话目标是纯文本就用paddleocr-text-recognition文档含表格、公式、图表或复杂版面的改用paddleocr-doc-parsing。skills/paddleocr-text-recognition/SKILL.md 里也写明了后者这类场景不要用文字识别 Skill 处理。这种带表格的登记表就是典型走paddleocr-doc-parsing而不是文字识别。第 2 步动手前自检确认 Python 版本 ≥ 3.9python --version。安装 CLI 依赖pip install paddleocr3.7.0拿到凭据登录百度 AI Studio在账户设置的 accessToken 入口复制你的 access token以 AI Studio 页面实际位置为准。为什么装完 pip 包就够了Skill 底层执行的是paddleocr api子命令它把文件提交到官方托管服务处理、轮询取回结果不在本机跑推理所以不需要 GPU也不需要额外依赖组。第 3 步三级安装主路径skills CLI 全局安装前提是本机装了 Node.js。命令可直接复制npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-text-recognition -y npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-doc-parsing -y只装一个就保留对应那一条。降级方案仓库体积大网络慢时npx skills add可能超时失败。先把仓库克隆到本地再从本地路径装git clone https://gitcode.com/GitHub_Trending/pa/PaddleOCR npx skills add ./PaddleOCR/skills/paddleocr-text-recognition npx skills add ./PaddleOCR/skills/paddleocr-doc-parsing这里的skills目录即仓库内的 skills/ 源码位置。可选分支clawhubOpenClawclawhub install paddleocr-text-recognition clawhub install paddleocr-doc-parsing安装位置与规则以 OpenClaw 官方 Skills 文档为准。手动路径前两条都不适用时克隆仓库把PaddleOCR/skills下对应 Skill 目录整体拷贝到你 AI 应用指定的 Skills 目录具体位置以该应用的安装文档为准。第 4 步写入配置两个 Skill 的 frontmatter 都把PADDLEOCR_ACCESS_TOKEN声明为必需环境变量primaryEnv缺了它 Skill 不会工作——因为它无法向官方服务完成鉴权。必填PADDLEOCR_ACCESS_TOKENaccess token可选PADDLEOCR_BASE_URLAPI base URL缺省走官方服务地址 常见宿主应用的写法Claude Code项目根目录.claude/settings.local.json加env字段ACCESS_TOKEN换成真实 token{ env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } }OpenClaw~/.openclaw/openclaw.json加 Skill 条目{ skills: { entries: { paddleocr-text-recognition: { enabled: true, env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } }, paddleocr-doc-parsing: { enabled: true, env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } } } } }应用不在以上列表时把 token 以PADDLEOCR_ACCESS_TOKEN环境变量提供给应用即可也可以单次调用时用--token显式传入。完整说明见 docs/version3.x/integrations/skills.md。第 5 步用自然语言触发配置完成后直接把任务说给 AI 应用。下面四条提示词可复制改写URL 与本地路径各两条提取这个文件中的全部文本https://example.com/invoice.jpg提取本地文件 C:\docs\invoice.pdf 中的全部文本。解析这个 PDF并返回主体内容和全部表格https://example.com/report.pdf解析本地文件 C:\docs\report.pdf并返回完整结构化结果。Skill 内部实际执行的命令形态可用它手动验证链路paddleocr api \ --model_type ocr \ --file_url https://example.com/image.pngpaddleocr api \ --model_type doc_parsing \ --file_path ./document.pdf关键参数规则--model_type必填取值ocr或doc_parsing--file_url与--file_path二选一。完整参数列表以paddleocr api --help为准参见 docs/version3.x/inference_deployment/serving/paddleocr_official_api/cli.md。第 6 步验收输出paddleocr api成功时输出格式化 JSON。文字识别结果看jobId和每页的prunedResult、ocrImageUrl{ jobId: job-xxx, pages: [ { prunedResult: { rec_texts: [Line 1, Line 2], rec_scores: [0.98, 0.95] }, ocrImageUrl: https://... } ] }文档解析结果看每页的markdownText、markdownImages、outputImages{ jobId: job-xxx, pages: [ { markdownText: # Title\n\nContent..., markdownImages: { img1: https://... }, outputImages: { layout1: https://... } } ] }验收条件pages覆盖你指定的全部页码用--page_ranges指定过范围时逐页核对且rec_texts/markdownText内容与源文档实际内容一致。指定--output时结果写入该文件并打印保存位置未指定则输出到标准输出。影响结果的可选开关API 默认开启文档预处理扭曲矫正use_doc_unwarping 方向分类use_doc_orientation_classify。输入平整、方向正确截图、规范扫描件时可关掉提速paddleocr api --model_type ocr --file_path ./document.pdf \ --use_doc_unwarping False --use_doc_orientation_classify False输入是弯曲/折叠文档照片、透视变形明显、或方向可能旋转 90/180/270 度时保持默认开启。排错⚠️ 失败信号很具体命令返回非零退出码错误信息输出到 stderr。出现时必须向用户说明具体问题不要静默失败更不要私自回退到应用自身的视觉能力去猜结果。现象原因动作stderr 报认证错误退出码非零PADDLEOCR_ACCESS_TOKEN缺失、无效或过期检查环境变量是否配置重新从 AI Studio 取新 token 替换stderr 报配额/限流错误请求触发限流或超出配额降低调用频率稍后重试结果提示未检测到内容图片为空白页或不含文字换一份确实含可识别文字的输入文件再验证边界与注意paddleocr-text-recognition不适用于含表格、公式、图表、复杂版面的文档这类任务一律切到paddleocr-doc-parsing。结果展示规则完整展示提取内容仅当内容超过 10,000 字符才允许省略。Skill 依赖paddleocrCLI由paddleocr3.7.0提供CLI 默认读取PADDLEOCR_ACCESS_TOKEN环境变量也可用--token单次显式传入。--output与--save_resources分别控制 JSON 落地文件和资源文件保存目录默认不落盘、直接打印到 stdout。用你手头一份真实 PDF 或图片按第 5 步的提示词跑一遍输出 JSON 里出现与文档内容一致的rec_texts或markdownText即说明从安装到鉴权、从触发到取结果的整条链路已打通。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表