ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

GLM-OCR化学结构识别微调案例:从示例数据集到部署上线

GLM-OCR化学结构识别微调案例:从示例数据集到部署上线 GLM-OCR化学结构识别微调案例从示例数据集到部署上线【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCRGLM-OCR 是一款总参数仅 0.9B 的轻量多模态文档 OCR 模型自带文本、表格、公式三类识别任务。本文使用项目内置的cosyn_chemical示例数据集带你完整走一遍数据准备 → 启动微调 → 部署上线的全流程教 GLM-OCR 识别化学结构式并输出标准 SMILES 化学式轻松接入现有解析流水线。为什么化学结构识别是理想的微调起点GLM-OCR 预定义了三种识别任务Text Recognition:、Table Recognition:、Formula Recognition:而化学结构式识别不在其中——这恰好是微调的典型场景用自定义 Prompt 教会模型新技能且不影响原有能力。数据量极小示例数据集只有 10 张化学结构图足以跑通全流程门槛低LoRA 微调单张 8 GB 显卡即可全参微调约需 24 GB结果可验证模型直接输出 rdkit 代码块中的 SMILES 化学式效果一目了然。示例数据集一览10 张图片 ShareGPT 标注示例数据集位于examples/finetune/目录由两部分组成图片文件夹examples/finetune/cosyn_chemical/10 张化学结构式 PNG涵盖氯代芳烃、带编号的糖链、脂肪酸酯链等不同类型标注文件cosyn_chemical.json标准 ShareGPT 多模态格式每张图对应一条提问 → 回答。其中一条训练样本大致如下{ messages: [ { role: user, content: imageCode Generation: }, { role: assistant, content: rdkit\nClC1CCC(C(C2CCC(Cl)CC2)...)\n } ], images: [cosyn_chemical/1.png] }三条注意事项新手最易踩坑文本中image标记的数量必须与images列表严格一致图片路径相对于 LLaMA-Factory 仓库的data/目录role只允许user或assistant两种取值。示例数据集中的化学结构识别图片启动微调三步走装环境、注册数据、跑训练完整图文教程见 examples/finetune/README_zh.md新手可精简为以下三步第一步安装微调框架安装 LLaMA-Factory 后还需手动升级 transformers 库版本旧版本暂不支持 GLM-OCR一条命令即可完成pip install --upgrade transformers模型权重可从 Hugging Face 或 ModelScope 下载也可跳过手动下载——在 YAML 配置中直接写model_name_or_path: zai-org/GLM-OCR训练启动时会自动拉取。第二步放置数据并注册数据集将cosyn_chemical.json与cosyn_chemical/图片文件夹移入 LLaMA-Factory 的data/目录并在data/dataset_info.json中按教程添加一条formatting: sharegpt的数据集条目。第三步选择训练配置一键启动项目贴心地提供了两套开箱即用的 YAML 配置配置文件微调方式单卡显存需求glm_ocr_lora_sft.yamlLoRA 微调lora_rank8学习率 1e-4≥ 8 GBglm_ocr_full_sft.yaml全参微调冻结视觉塔只训语言模型学习率 1e-5≥ 24 GB 自定义新任务时template必须保持glm_ocr任务 Prompt 可自定义示例使用Code Generation:并把图片放在 Prompt 之前imageCode Generation:。启动训练只需一条命令checkpoint 会自动保存到配置中指定的output_dirllamafactory-cli train path/to/glm_ocr_lora_sft.yaml数据量充足、算力充裕时优先全参微调否则选 LoRA——速度快、显存省适合绝大多数领域适配场景。训练完成后的三条部署上线路径路径 1合并 LoRA 权重 模型服务LoRA 微调结束后先用llamafactory-cli export命令合并 adapter 权重examples/finetune/README_zh.md 的常见问题里附了完整命令再用 vLLM 或 SGLang 指向合并后的目录启动服务即可GPU 机器上的完整流水线源码位于 glmocr/ocr_client.py。路径 2SDK CLI / Python 接口一行调用安装 SDK 并在config.yaml中配置服务地址后一条命令即可解析glmocr parse your_chemical_structure.pngCLI 入口见 glmocr/cli.py也支持parse(image.png)这样的 Python API 便捷函数。路径 3Server / Client 分离部署Client 免 GPU在 GPU 机器上运行 SDK Server其他机器通过 HTTP 以 MaaS 兼容协议远程调用架构说明见 examples/self-host/README.md服务源码位于 glmocr/server.py。适合一张卡服务整个团队的场景。快速自查清单阶段关键动作参考位置数据准备10 张图 JSON 标注放入 LLaMA-Factory 的data/目录examples/finetune/注册数据集dataset_info.json添加 sharegpt 条目README_zh.md启动训练LoRA 8 GB / 全参 24 GB 两种 YAMLglm_ocr_lora_sft.yaml部署上线合并权重 → 模型服务 →glmocrCLIglmocr/server.py从几十行 JSON 标注到上线可调用服务全程训练耗时通常只有几个小时——这正是 0.9B 轻量参数带来的红利让领域定制 OCR对普通开发者来说也不再是高门槛的事。【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表