ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

pxpipe Gemini 网关视觉质量评测套件实战指南:模型准入、三维质量基准与渲染画像验证

pxpipe Gemini 网关视觉质量评测套件实战指南:模型准入、三维质量基准与渲染画像验证 【免费下载链接】pxpipecut Claude Code token usage by rendering text context as images项目地址https://gitcode.com/gh_mirrors/px/pxpipe点击查看免费下载导读本文以 pxpipe 仓库中eval/gemini-profile目录下的 Gemini 网关视觉质量评测套件为线索完整讲解如何在本地 Cloudflare AI Gateway 上验证 Gemini 图像模型的可用性、准入边界与渲染质量。你将掌握为什么网关目录中看似可用的模型 ID 并不等于可安全调用GLM 冒充、文本-only 模型被客户端主动拒绝、如何用三条生产级质量基准novel-arithmetic / gist-recall / verbatim-hex对模型做图像阅读能力验收以及 pxpipe 如何为 Gemini 建立平坦计价的视觉 Token 画像并据此决定渲染几何。读完本文你可以直接复现整套评测流程并理解每条结论背后的源码级证据。一、套件定位评测什么、为什么在网关层评测eval/gemini-profile/README.md开宗明义这是一套Gateway visual quality suite评估的对象是由本地 Cloudflare AI Gateway 暴露的 Gemini 图像模型。它与 pxpipe 项目的核心主题通过把文本上下文渲染成图像来削减 Claude Code Token 用量直接挂钩——只有视觉模型在读图上足够可靠把系统提示、工具文档、对话历史折叠成 PNG 的压缩策略才站得住脚。套件的技术链路是评测脚本 (eval/gemini-profile/*.mjs) → renderTextToPngs() 渲染文本为 PNGdist/core/render.js 构建产物 → resolveGeminiProfile() 取渲染画像列数、行高、字体、事实表格式 → callGemini() / callGeminiRequest() 经本地网关转发到 Google AI Studio → 写回模型限定名的结果文件不覆盖旧模型收据评测在网关层进行而不是直连 Google API原因有二一是 pxpipe 本身以本地网关/代理为运行形态评测必须走与生产完全一致的请求路径/google-ai-studio/v1beta/models/{model}:generateContent二是网关目录里同时存在多种看起来能处理图像的模型套件必须先做准入甄别见第二节。二、模型准入哪些模型真的能读图README 记录了两个关键的准入结论这也是最容易踩坑的地方gemini-3.7-flash是唯一确认可用的 Gemini 图像模型 ID经由 Google AI Studio 通道。网关目录里不存在gemini-4.7。名字相近的workers-ai/cf/zai-org/glm-4.7-flash实际上是 GLM 而非 Gemini——尽管其目录信息宣称支持附件live 端点实际会拒绝图像输入非多模态。DeepSeek v4以workers-ai/cf/deepseek-ai/deepseek-v4-flash和workers-ai/cf/deepseek-ai/deepseek-v4-pro形式存在但两者都被声明为 text-only。评测客户端会主动拒绝它们而不是把无效的图像读取分数记入结果。这条客户端主动拒绝的逻辑在 eval/gemini-profile/gemini-client.mjs 里有实现依据callGemini()把内容部分映射为 Gemini 协议部件input_image必须携带data:image/png;base64,...形式的 base64 数据不支持的部件类型直接throw new Error(unsupported Gemini content part: ...)。也就是说评测客户端只接受真正多模态的模型其余模型在请求构造阶段即被挡下从机制上杜绝了把纯文本模型的胡编乱造当成图像阅读分数的污染。请求客户端细节gemini-client.mjs值得注意的实现点网关源地址取自环境变量OPENAI_BASE_URL去掉末尾斜杠后取origin请求路径为/google-ai-studio/v1beta/models/{cleanModel}:generateContent认证头为x-goog-api-key密钥取OPENAI_API_KEY或GEMINI_API_KEY。模型 ID 会先剥掉google/前缀并做净化replace(/[^a-zA-Z0-9._-]/g, _)。每个请求有默认 120 秒超时AbortController实现generationConfig.maxOutputTokens默认 1000。响应解析会过滤thought部件只拼接真正的文本输出usage 取usageMetadata并记录端到端耗时ms。结果文件名按模型区分gemini-3.6-flash写{suite}-results.json其余模型写{suite}-{sanitizedModel}-results.json这正是 README 所说每个运行写出模型限定结果文件、不覆盖既有 Gemini 3.6 收据的实现。三、构建与运行三条质量基准的完整命令README 给出的运行流程是先构建、再跑三套评测pnpm run build MODELgemini-3.7-flash LIVE1 node eval/gemini-profile/novel-arithmetic.mjs MODELgemini-3.7-flash LIVE1 node eval/gemini-profile/gist-recall.mjs MODELgemini-3.7-flash LIVE1 node eval/gemini-profile/verbatim-hex.mjs两个关键约定必须先pnpm run build三个脚本都从../../dist/core/*.js导入渲染器、Gemini 画像与事实表模块依赖构建产物存在。LIVE1才真正调用模型没有LIVE1时脚本只做dry run生成题目、渲染图片、打印将要执行的内容后立即退出且不写收据文件。这是防止误触 API、误计费的默认安全开关三条基准的实现里都显式处理了这个分支novel-arithmetic.mjs中if (!LIVE) { ... process.exit(0) }verbatim-hex.mjs同样如此。环境变量约定三条基准共用变量默认值作用MODELgemini-3.6-flash被测模型 ID评测 Gemni 3.7 时必须显式设为gemini-3.7-flashLIVE未设置1时执行真实 API 调用并写结果TIMEOUT_MS180000novel/ 240000gist/ 90000verbatim单次调用超时OPENAI_BASE_URL/OPENAI_API_KEY或GEMINI_API_KEY—网关地址与密钥缺失时客户端直接抛错novel-arithmetic 还支持N题目数默认 100、SEED伪随机种子默认 20260711、CONCURRENCY并发数默认 5verbatim-hex 支持MAX_OUTPUT_TOKENS默认 80。四、三条质量基准的评测设计4.1 novel-arithmetic文本 vs 纯图像 vs 生产式图像推理novel-arithmetic.mjs 用 LCG 伪随机数生成 100 道新型四则应用题加法工厂产量、蓄水池出入水、仓库货架散箱、体育场余票保证题目不在模型训练集里。对每题执行三臂对比text 臂纯文本提问对照组。pure 臂renderTextToPngs()把题目渲染成 PNG以 base64input_image提交配一句问题在图中的提示纯图像路径。prod 臂图像 factSheetText()生成的精确数字事实表 提示模拟生产形态即 pxpipe 折叠系统提示时附事实表的做法。评分提取答案文本中的ANSWER: number与 gold 答案严格相等才算对。每条记录同时写入imageTokens用visionTokensForModel()按模型与图片尺寸估算、三臂的 usage 与错误信息最终汇总textPct / purePct / prodPct三组正确率写入novel-arithmetic-{model}-results.json。4.2 gist-recall长会话转录的语义回忆与防幻觉守卫gist-recall.mjs 读取eval/gist-recall/下work、work2、work3三个语料目录每目录含probes.json与s{id}.txt会话文本把每个会话源码文本整体渲染成图像序列要求模型按顺序阅读全部转录图逐题回答找不到就答 UNKNOWN只输出按题目顺序排列的 JSON 字符串数组。它的评分器correct()按问题类型区分判定unanswerablenever-stated 守卫题答unknown才算对——这类题故意问转录里从没出现过的信息用于测量编造率numeric答案在文本中以(?:^|\D){gold}(\D|$)形式出现才算对negation必须包含off且不含enabled其余子串包含即对。输出汇总三个指标answerable可答对的正确率/完成数、statework3子集的状态跟踪正确率、unanswerable守卫题中被编造的数量越低越好。三条 tier 的会话规模为 10 / 6 / 6 个。4.3 verbatim-hex密集日志的逐字读取极限verbatim-hex.mjs 针对 pxpipe 最担心的场景——图像化文本的逐字verbatim召回。它从eval/verbatim-15/golds.json读入 15 个 trial每个 trial 用denseLog()生成 80 行密集 JSON 日志第 2 行是含目标 12 位十六进制id与特定dur_ms的目标行其余为填充行渲染成 PNG 后提问找到dur_ms恰好等于 X 的那一行只返回它的id字段恰好 12 位小写十六进制。匹配规则是正则[0-9a-f]{12}与 gold 全等。脚本每完成一个 trial 就实时写一次结果文件writeResult(rows)在循环内被调用因此中途失败也能保留已完成的收据最终输出correct/completed/errors汇总到verbatim-hex-{model}-results.json。这三条基准恰好覆盖图像化文本的三个不同风险面推理正确性能读懂题目并算对、语义回忆与防幻觉长转录中找得到信息、找不到不乱说、逐字精度密集场景下逐字符正确。五、为什么是 1568×728Gemini 画像的源码级依据三条基准都通过resolveGeminiProfile()src/core/gemini-model-profiles.ts获取渲染画像。Gemini 3.6 Flash 的专属画像3.7 Flash 直接复用其几何数据关键字段如下export const GEMINI_3_6_FLASH_PROFILE: GptModelProfile { // Flat per-image charge. Live usage measured the exact production canvas at // 1,078 IMAGE tokens; other measured shapes ranged up to 1,113 ... vision: { regime: flat, tokens: 1120, exact: { widthPx: 1568, heightPx: 728, tokens: 1078 } }, stripCols: ANTHROPIC_STRIP_COLS, // 312 列 maxHeightPx: ANTHROPIC_MAX_HEIGHT_PX, // 728 px factSheetFormat: compact, history: { maxImages: 32, keepTail: 4, ... }, style: { font: spleen-5x8, aa: true, grid: false, ... }, };这里最反直觉的结论是Gemini 3.6/3.7 Flash 的视觉 Token 计价是平坦的。eval/gemini-profile/GEMINI_VISION_RESEARCH.md记录的实测显示从 100×100 到 4096×512 的各种尺寸单图计费 Token 稳定在 1,034–1,113 区间几乎与像素分辨率、宽高比无关。vision-cost.ts中regime: flat分支的实现正是尺寸与生产几何1568×728完全一致时按实测精确值 1,078 计费否则按画像默认值 1,120 计费。这一计价特性带来两个直接推论更大的可读画布 每个视觉 Token 能装下更多字符。既然单图成本几乎固定就应该把画布撑到不触发降采样的极限而不是用小图省 Token。这正是 1568×728 被选中的原因在 src/core/render.ts 中MAX_HEIGHT_PX 728的注释记录了实测依据——API 会把任何图像降采样到长边 ≤1568 且 ≈1.15MP以内然后按 28px patch 数计费1568×728 1,141,504 px同时落在两个边界内渲染出的 5×8 字形以原生分辨率进入视觉编码器WYSIWYG不会被模糊。312 列是经过精确计算的312 列 × 5px 字宽 8px 左右 padding 1568px恰好压在 API 长边边界上313 列会变成 1573px 触发 0.997× 重采样把每个字形弄糊。DENSE_CONTENT_COLS 312与LINES_PER_IMAGE按floor((728 − 8) / 8) 90 行共同给出每图约 28,080 字符的容量预算。GEMINI_VISION_RESEARCH.md还记录了被否决的两个方向RGB 三通道叠加多路复用物理字符碰撞会破坏 ViT patch 嵌入合并图 0/12 正确率单通道则 12/12和多列排版单列 312 字符 30 图 32,340 Token双列/三列在引入阅读顺序风险的同时 Token 反而更多二者都被排除出生产路径。六、质量基线3.6 Flash 的收据与中间迷失补充实验eval/gemini-profile/QUALITY_RESULTS.md记录了 Gemini 3.6 Flash 在发货画像Spleen 5×8、312 列、728px、紧凑事实表下的完整基线测试N结果说明novel arithmetic100100/100纯图像与文本均为 100/100gist recall9898/9822 个会话全部完成state tracking1818/18gist 语料子集never-stated guards160/16 编造越低越好dense 12-char hex1514/15全部调用完成基线结论在该几何下Gemini 3.6 Flash 在推理、状态跟踪、防幻觉上与已记录的 Fable 5 持平密集逐字阅读 14/15 略优于 Fable 的 13/15。README 要求对3.7 Flash 重跑同样的三条基准目的就是把这份收据复制到新模型上。此外lost-in-middle.mjs与lost-in-middle-{scale}-{model}-results.json是同一目录下的补充实验它构造约 30 万字符的多轮遥测流把关键状态变更注入 10%–90% 的五个深度位置通过transformGoogleGenerateContent()src/core/google.ts 的生产转换函数对比原始文本臂与pxpipe 图像臂。5%–95% 深度扫描2,000/6,000/10,000 条记录的结果显示pxpipe 在行定位上略优18/30 vs 17/30、原始文本在语义状态识别上略优11/30 vs 13/30、精确检索持平3/30 vs 3/30作者明确标注这些差异是方向性的而非定论且 14/15 密集 hex 只度量小控制页的清晰度、98/98 gist 只度量自然语言语义回忆都不能外推为一般长上下文检索优势。这是评测套件在诚实性上的范本——结论与限制条件总是成对出现。七、扩展同一目录下的配套研究脚本除三条主基准外eval/gemini-profile/还沉淀了画像研究阶段的配套脚本可用于复现定价与几何结论dimension-research.mjs12 组尺寸/宽高比探针的 Token 计费实测产物dimension-research-results.jsonresolution-sweep.mjs7 组列数 × 高度组合的清晰度阈值扫描产物resolution-sweep-results.jsonrgb-separation-diagnostic.mjsRGB 通道分离诊断支撑多路复用被否决的结论。这些脚本与主基准共享同一客户端、同一LIVE1开关约定可直接替换MODEL环境变量复跑。八、总结如何把你的模型纳入这套质量门槛把本文内容落地为可复用的验收流程准入甄别先确认目标 ID 在网关目录中的真实形态Gemini / GLM / DeepSeek 等再确认它是否真正多模态——不要相信目录里的 attachment 声明用一次LIVE1小样本试跑验证。画像校验确认gemini-model-profiles.ts中存在该模型的画像3.7 Flash 复用 3.6 的实测几何3.8、3.9、4、5 及注册的 3.6/3.7/3.1 flash 模型由hasGeminiMeasuredProfile()放行否则transformGoogleGenerateContent()会以unsupported_model直接放行原请求、不做压缩。三基准验收按 README 的构建 三条命令顺序执行以 3.6 Flash 的基线100/100、98/98、14/15、0/16 编造为参照评估新模型结果写入模型限定名文件与旧收据并存。整个套件证明了一件事图像化压缩文本这件事的质量底线是可以被系统化度量的——准入有机制客户端拒绝 text-only 模型、成本有实测平坦计价画像、质量有三维基准推理 / 回忆与防幻觉 / 逐字精度并且所有结论都留有可复核的 JSON 收据与源码实现。赞分享【免费下载链接】pxpipecut Claude Code token usage by rendering text context as images项目地址https://gitcode.com/gh_mirrors/px/pxpipe点击查看免费下载相关推荐Grok 质量评测套件实战在 Codex Responses 路径上度量 pxpipe 图像管线的精确召回与幻觉防线Grok 质量评测套件实战在 Codex Responses 路径上度量 pxpipe 图像管线的精确召回与幻觉防线 本指南以 eval/grok densi猫抓Cat-Catch专业浏览器资源嗅探工具的终极指南猫抓Cat Catch专业浏览器资源嗅探工具的终极指南 你是否曾经遇到过一个精彩的在线视频想要保存下来却无从下手或者需要下载网页上的音频素材却找不到方法音视频EtherCalc 终极指南如何快速构建多用户协作电子表格EtherCalc 终极指南如何快速构建多用户协作电子表格 EtherCalc 是一款基于 Node.js 的多用户协作电子表格工具它允许团队成员实时共同编后端上一篇NOTEARS算法革命性图结构学习的连续优化方案下一篇BRMS贝叶斯建模完全指南从入门到精通创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表