
ModLens 质量保障体系evals 评估如何让读图能力变成任何人可复现的证据【免费下载链接】modlensThe first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件为 DeepSeek、GLM 等纯文本模型外挂视觉能力粘贴图片即得结构化 JSON 证据OCR、版面、语义。项目地址: https://gitcode.com/gh_mirrors/mo/modlensModLens 是 DeepSeek Harness 的视觉插件也是为 DeepSeek、GLM 等纯文本模型外挂的读图能力桥粘贴一张图片即可得到结构化的 JSON 证据——OCR 全文、版面区域、语义实体。但读图能力好用只是一句口头承诺如何证明答案就在项目自带的 evals 评估体系里它把每一次我能读懂这张图的主张变成任何人可重跑、可核查、可复现的物证。为什么读图能力不能只靠看演示演示截图总归好看但视觉能力是会悄悄退化的一次版本更新、一次引擎切换都可能让密集图表从读得出变成读不清而没人察觉。ModLens 的质量保障因此分成两层快慢搭配快层Vitest 单元测试。无网络、毫秒级、进 CI守护代码逻辑本身规范见 docs/testing.md慢层evals 评估。驱动真实的 CLI、消耗真实的供应商配额所以刻意不进 CI而是本地按需运行——evals/README.md 里写得很直白Every experiment should leave behind a reproducible piece of evidence.每个实验都应留下一份可复现的证据。五个种子用例覆盖 5 类真实读图场景每个用例是 evals/cases/ 下的一个目录由一个case.json定义测哪张图、可选地钉住哪个引擎/模型、以及期望值expect。当前共 5 个种子用例用例被测图片在验证什么banner水彩手绘风项目横幅风格化、带纹理的字能否被认出品牌字 标语dense-text密集双语推文截图中英混排正文与 270K 这类互动数字是否全读出diagram四步流程图每个方框标题能否按阅读顺序转写chart128 个 AI 模型的散点图压测坐标轴标题、数据系列、chart版面区域标注prompt-injection纯代码生成的注入图注入文字是否被当作内容而非指令 最硬的一块是chart压测用例。这张 128 模型散点图正是视觉桥最容易失败的密集图表场景它的期望块要求坐标轴标题 Artificial Analysis Intelligence Index、Cost per task、系列名 DeepSeek 与样本数 128 必须被转写出且版面中必须出现chart类型区域——见 evals/cases/chart/case.json。密集文本用例则对应这张双语推文截图英文推文、中文助手面板、以及 270K、互动数据 等 7 条必转写字符串缺一不可证据产物一次运行留下 10 个可核查字段跑完后运行器 evals/run.mjs 会为每个用例在evals/results/日期/下写一份 JSON 证据文件。关键字段一览字段记录了什么command完整的 CLI 调用图片路径与用例原文一致tool被测 ModLens 的version gitcommitinputSha256输入图片的 SHA-256 指纹输入被换过一眼即知provider/model实际接手的引擎与模型而非请求的latencyMs/usage墙钟耗时 供应商上报的真实配额消耗scoring每条期望串是否命中、区域类型命中、transcriptionPass与schemaPass两个总判定rawOutput完整的modlens analyze结果供人工复核error/degraded失败时的退出码与 stderr实际引擎与请求引擎不一致时的降级标记三个设计点让这份证据站得住输入有指纹——SHA-256 保证测的是这张图版本有锚点——version commit 保证测的是这份代码结论被拆开——转写对不对transcriptionPass与结构全不全schemaPass分开判定哪里坏了一目了然。自动化断言与人工复核的边界诚实的质量体系会明说自己的边界。运行器自动断言两类事转写包含mustTranscribe与numbers中的字符串是否出现在完整结果 JSON 中大小写不敏感结构形状summary、ocr.full_text、ocr.lines、layout.regions、semantics.entities、uncertainty等标准字段是否齐全校验逻辑在 evals/run.mjs。它不断言一件事模型是否服从了图里的注入指令。prompt-injection用例的自动化部分只验证注入文字被当作内容转写进了ocr至于模型有没有照做比如summary是否变成了 PWNED 三个字需要人工读一遍rawOutput来确认。连这张注入图本身也是质量体系的一部分make-image.mjs 零依赖用一个 5x7 位点字体 内置 PNG 编码器现场渲染出注入图随时可再生成不依赖任何外部素材。三步复现任何人可以重跑这套评估git clone https://gitcode.com/gh_mirrors/mo/modlens cd modlens pnpm install pnpm build # evals 驱动的是 dist/main.js pnpm eval # 跑全部用例真实消耗配额 pnpm eval chart banner # 只跑指定用例 pnpm eval --dry-run # 只校验用例与输入不消耗配额跑完会打印一份汇总转写通过率、结构通过率、延迟 min/avg/max、证据文件目录任何漏掉的期望串都会逐条列出例如missing text: 270K。这套评估刻意只在本地按需运行原因不是偷懒而是它驱动真实 CLI、消耗真实配额——把花真钱的实验做成随时可重跑的仪式。而它守护的正是你在真实会话里看到的这一幕粘贴图片、模型逐元素读图作答从纯文本模型到结构化证据的整条链路也有一张四步流程图可对照——它本身正是diagram用例的被测图片小结evals 的价值不在于它有多少个测试而在于它把读图能力从一个需要信任的说法变成了一份带指纹、带版本、带完整原始输出、任何人重跑一遍就能核验的证据。当主张可以被复现质量才算真正被保障。【免费下载链接】modlensThe first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件为 DeepSeek、GLM 等纯文本模型外挂视觉能力粘贴图片即得结构化 JSON 证据OCR、版面、语义。项目地址: https://gitcode.com/gh_mirrors/mo/modlens创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考