
上架一款自动饮水机之前我照例要整理商品资料包标题、卖点、SKU明细、质检报告、品牌授权书、发货售后说明外加一张主图。这些材料散落在 Excel、Word、PDF 和图片里过去我都是开好几个窗口来回比对着看碰上大促前集中上新品基本一整天就搭进去了。最近我把 Qwen3.8-Max 接进这个流程搭了一个商品资料包体检助手把 6 份资料和 1 张商品图一次性丢进去5 分钟不到返回一份带问题分类的体检报告总共查出 27 个问题。这篇文章就把我怎么设计检查项、怎么写提示词、怎么处理图片和长文本、以及实测中踩过的坑完整复盘一遍。适合三类人看经常上架商品的电商运营、想给供应链审核提效的商品经理、以及对大模型多模态应用感兴趣的开发者。1. 商品资料包体检到底在检什么1.1 一次被平台下架的教训先说我为什么要做这个东西。之前我上架一款保温杯资料包里质检报告是齐全的标题、主图也都按规定做了结果上架第二天就被平台提示“材质宣称与质检报告不符”。后来一查问题出在详情页里一句“杯身材质为304不锈钢”而质检报告上写的实际是“奥氏体不锈钢06Cr19Ni10”。这两者在日常叫法里是同一个东西但平台审核系统不认它只做关键词匹配。那次被下架罚款加重新整改前后折腾了四天。这件事让我意识到电商审核里的“问题”不是单一维度的。它至少包含三层合规层有没有违反广告法、平台规则的极限词、违禁词证据层宣传的材质、功能、资质是不是有对应的证书或报告支撑一致性层标题、详情页、SKU表、发货说明之间同一个信息在不同文件里是不是对得上。这三层问题人工审核时会因为注意力分散而漏掉。A文件里写蓝牙5.3B文件里写蓝牙5.0分开看都能通过放在一起看就是矛盾。所以商品资料包体检本质上是一个多维度的交叉比对加风险扫描任务非常适合交给大模型来做。1.2 人工审核为什么会漏人工审核漏问题不是粗心的问题是方法的问题。第一信息来源太多。同一个商品的信息分布在标题里、卖点里、规格参数里、质检报告里、主图角落里。人脑的短时记忆容量有限看完第5个文件第1个文件里的关键数字已经模糊了。第二知识盲区。不是每个运营都背得住广告法违禁词也不是每个人都知道“最”“第一”“顶级”“100%”这些词在什么场景下不能用更别说检测标准、材质命名规则这些专业细节。第三瞬时判断和持续判断的差别。人看资料是“扫一眼”模型是“逐字过”。我实测下来模型对显式违禁词的召回率比我人工扫两遍还高因为它不会累。还有一个容易被忽视的点这类审核动作的产出物过去是不可留存的。人工看完了结论在脑子里不写报告就等于没查。而让模型来做它每次都能输出一份结构化的检查清单问题类型、严重级别、所在文件、建议改法都列出来这本身就是一种流程资产。2. 体检助手的整体设计方案2.1 为什么选 Qwen3.8-Max技术选型时我对比过几套方案最终选了 Qwen3.8-Max理由有三个。第一多模态输入。商品资料包里必然有图片主图、详情页、授权书扫描件都是图片。Qwen3.8-Max 能直接读图不需要我先做一轮OCR再拼接文本少了一层信息损耗。第二上下文窗口够长。6 份资料整理完文本量大概在 1.2 万到 1.5 万 tokens 左右加图片输入后整体还在可控范围内。窗口太小的话就得拆成好几轮对话前后的信息可能互相丢失。第三中文电商语料的把握比较准。广告法违禁词、平台规则表述这一类中文语境很强的内容用中文训练占比高的模型比通用英文模型稳定很多。我实测过某英文模型它能把“最舒适”翻译成 very comfortable 然后放过去而 Qwen3.8-Max 会直接标出来这属于绝对化用语风险。当然选型也要看成本。这类体检任务不是高频操作但对单次输出的质量要求高。按我的用量一个品跑一次的成本大约在几毛钱级别比人工半小时的时间成本划算得多。2.2 我准备的6份资料和1张图我的资料包固定包含这6份文本资料和1张商品图序号资料名称格式包含的核心信息1商品基础信息表Excel标题、卖点、属性参数、类目、价格2主图文案说明Word促销文案、角标文字、卖点描述3SKU规格明细表Excel规格名、SKU图链接、价格、库存4质检报告PDF检测项目、检测结论、材质成分5品牌授权书图片授权品牌、授权范围、有效期6发货与售后说明Word发货时效、运费模板、退换货政策7商品主图图片商品实物图、促销角标、文案排版很多团队做资料体检时只检查前三项也就是标题、价格、SKU。但真正让商品出问题的往往是后几项。质检报告和授权书属于“证据链”主图和角标属于“视觉合规”发货说明属于“履约承诺”。检查范围不覆盖这些体检就缺了一条腿。2.3 整个流程分四步走我的实现思路不复杂核心就四步。第一步资料整理。把 Excel、Word、PDF 先转成纯文本按标准格式拼接成一个“资料包速览”文档每份资料标明文件名和来源。第二步信息提取。让模型先把所有资料里出现的实体信息抽出来包括品牌、型号、材质、规格、价格、时效、检测项目、授权范围等。这一步相当于先建一张“事实表”。第三步交叉比对。把所有同类型的实体放在一起让模型逐项比对找出互相矛盾的地方。比如标题写“续航30天”说明书写“续航15天”在这里就会暴露。第四步风险扫描。这一步不只是查违禁词还会结合证据链判断。比如“100%纯棉”如果质检报告里没有对应的检测数据就会被标记为“无证据支撑的宣传”。四步分开做比一次性让模型“帮我看看有什么问题”要稳得多。分步之后模型每一步的任务很明确输出格式也固定不容易漏项也方便我定位问题到底出在哪个阶段。3. 核心实现提示词模板和多模态处理3.1 体检提示词模板下面是我实际在用的提示词模板去掉了具体商品名你可以直接套用。我把提示词分成了“全局指令”“资料清单区”“检查维度区”“输出格式区”四段。【角色】 你是资深电商合规审核专家精通广告法、平台商品发布规则、质检与授权链路审查。 你现在要对一组商品资料做发布前体检。 【资料包】 以下是待检查的商品资料每个文件前面标注了文件名请先完整阅读再开始检查 --- 文件1商品基础信息表 --- {填标题、卖点、属性参数、价格} --- 文件2主图文案说明 --- {填文案、角标、卖点} --- 文件3SKU规格明细表 --- {填规格名、SKU图、价格、库存} --- 文件4质检报告 --- {填检测项目、结论、材质} --- 文件5品牌授权书 --- {填授权品牌、范围、有效期} --- 文件6发货与售后说明 --- {填时效、运费、退换货} --- 图片7商品主图 --- {描述图上文字、角标、商品主体遮挡情况} {多模态场景下这里直接传图片} 【检查维度】 请按以下8个维度逐项检查 1. 标题与关键词合规字数、违禁词、关键词堆砌、品牌词混用 2. 价格信息一致性划线价、SKU价、活动价之间是否冲突 3. SKU规格完整性规格名是否齐全、SKU图是否对应、库存是否异常 4. 主图与详情页合规牛皮癣面积、促销文字、极限词、遮挡主体、图片清晰度 5. 资质与授权核对质检报告是否覆盖宣传卖点、授权书是否在有效期内、类目是否匹配 6. 发货售后一致性发货时效、运费、退换货政策是否与承诺一致 7. 参数与尺码表尺码/规格/单位/材质标注是否完整准确 8. 跨文件一致性同一信息在多个文件中出现时是否一致 【输出要求】 输出JSON格式字段为 { total_issues: 数字, issues: [ { level: 高/中/低, dimension: 对应检查维度, location: 问题所在文件名, detail: 问题描述引用原文, evidence: 判断依据, suggestion: 建议修改方式 } ] } 如果没有问题issues返回空数组。注意不要遗漏跨文件比对发现的问题。这个模板最核心的地方在最后一句“不要遗漏跨文件比对发现的问题。”模型在默认情况下更倾向于处理信息密集的显式问题比如违禁词而跨文件冲突这种需要“自己翻回去对比”的任务需要被明确点出来否则召回率会明显下降。3.2 多模态图片检查怎么落地图片检查这块我踩过不少坑详细说下我的做法。首先要解决的是图片尺寸问题。原始主图通常 2000 乘 2000 以上直接传会消耗大量 token还可能因为缩放导致角标文字看不清。我的做法是先用 Python 的 PIL 库把图片等比压缩到长边 1200 像素把角落的促销角标单独截一块出来做局部放大一并传过去。这样模型既能看清整体构图也能看清角标上的小字。from PIL import Image def prepare_image_for_check(image_path): img Image.open(image_path) # 等比压缩到长边1200 max_side 1200 ratio max_side / max(img.size) if ratio 1: img img.resize((int(img.width * ratio), int(img.height * ratio)), Image.LANCZOS) img.save(main_image_compressed.jpg, quality85) # 截取右下角促销角标区域放大两倍 w, h img.size corner img.crop((int(w * 0.6), int(h * 0.7), w, h)).resize( (int(w * 0.4 * 2), int(h * 0.3 * 2)), Image.LANCZOS ) corner.save(corner_zoomed.jpg, quality90)接着在提示词里我会加一段图片专项描述。让模型关注 4 件事图片上有哪些文字、文字有没有遮挡商品主体、角标里是否出现绝对化用语、整体画面上有没有疑似侵权的 logo 或图案。这一步得到的描述文本再和文本资料里的卖点做交叉比对。比如图片上写着“限时特惠99”SKU表里定价129这种不一致就会被查出来。有一个细节提醒模型读图识别的文字不一定100%准确尤其碰到艺术字体或者低对比度文字。所以图片类问题我会把模型的输出当作“候选问题”再用 OCR 工具复核一遍文字区域的识别结果。对我这种小规模使用场景优先保证发现问题不追求一次全对。3.3 长文本拼接的注意事项资料整理阶段最容易翻车这里单独提醒三个点。一是 Excel 转文本。SKU 明细表里如果有多级表头直接转 CSV 会出现一堆空单元格模型读起来非常痛苦。我的处理方式是先在 Excel 里做一次透视简化为“规格名、价格、库存、图片文件名”四列再转文本。信息密度高的表格模型识别准确率会高很多。二是 PDF 里的表格。质检报告经常是表格形式直接转文本容易把表格拆散。我优先用带 OCR 能力的 PDF 提取工具把表格按单元格顺序输出再加一行行列索引让模型能理解结构。如果原 PDF 是扫描件那只能先 OCR 再人工校对一遍关键字段。三是文件来源标注。每段文本前面必须标明它来自哪个文件否则模型输出问题定位时只能写“在某处”你根本没法回去改。我见过不少人的提示词不标来源模型确实能查问题但查完等于没查因为定位不到文件。4. 实测过程与27个问题复盘4.1 一次完整的实测记录我用一款“自动饮水机”真实走了一遍流程。资料包整理后大约 1.3 万 tokens加一张压缩后的主图。模型跑一遍从提交到输出完整 JSON耗时约 4 分半查出来 27 个问题。这个耗时里边有图片识别的部分纯文本检查会更快一些。我没有直接把模型输出当结论而是又做了一轮人工复核把 27 个问题按严重级别和类别重新归类。归类后发现模型真正厉害的地方不在“查违禁词”这种显式任务而在那些我们平时容易略过的隐性矛盾。比如商品标题写“支持手机App远程控制”说明书里的 App 只支持 Android 端iOS 版本还在开发中。这个信息散落在两个文件里人工绝对不容易看出来但模型在交叉比对时直接标了出来。4.2 27个问题分类统计我把 27 个问题整理成了下面的表格方便你直观感受体检的覆盖面。问题类别数量严重级别分布典型例子违禁词与极限词4高2 中2标题含“最舒适”、详情页含“全网第一”、主图角标含“顶级”价格与SKU信息5高3 中2划线价高于吊牌价、部分SKU价冲突、SKU图缺失资质与授权4高2 中1 低1质检报告检测项目不覆盖“无线充电”卖点、授权书即将过期主图与视觉合规5中3 低2角标文字遮挡商品主体、牛皮癣面积约35%、疑似未授权品牌logo参数与尺码表4中2 低2尺码表缺测量数据、“电池容量”单位标错发货与售后3高1 中2发货时效48小时和详情页“当天发货”冲突跨文件信息不一致2高2标题蓝牙5.3、参数表蓝牙5.0卖点续航30天、说明书15天7 类问题加起来正好 27 个。这里要说明一下这个分类是我在模型输出的基础上按业务口径重新归的。模型输出的是带 dimension 字段的原始 JSON我统计了一下它自己标注的维度分布和我的归类重合度在 85% 左右。剩下 15% 的差异主要是模型会把一个根因引发的问题拆成两条比如价格冲突在 SKU 明细表和活动规则描述里各报了一次这其实不影响使用。4.3 典型问题怎么修体检的意义不只是发现问题还得能指导修改。我挑三个典型问题说说修复逻辑。第一个是违禁词。“最舒适”这种绝对化用语直接删掉或者改成“体感舒适”就行。“全网第一”这种既违反广告法又没法自证的说法改成“我们精选的2024年畅销款”会更稳。这里有个经验不要只删词要连上下文一起改。单纯删掉“最”剩下“舒适材质”读起来很怪反而影响转化。第二个是资质不匹配。质检报告检测的是“食品接触材料安全性”但标题卖点却在写“无线充电功能”。这是典型的证据链断裂。修复方式两种要么把没检测过的宣传点删掉要么补做对应项目的检测再上传。我这次选的是后者因为无线充电是核心卖点删掉竞争力就没了。第三个是发货时效冲突。SKU 页写的“48小时内发货”详情页却写着“当天发货”。这不是单纯的笔误背后往往涉及仓库实际产能。如果仓库做不到当天发货详情页必须改。我把两个页面统一成了普通地区48小时、偏远地区72小时并且备注了周末顺延避免被投诉虚假发货。5. 常见问题与避坑技巧实录5.1 我会遇到的五个高频翻车点提示词里没有限定输出格式模型回答小作文解析困难。解决方法是输出要求写死为 JSON并且在 JSON 前后不要加任何说明文字。如果模型偶尔不听话可以在系统提示里加一句“直接输出JSON不要输出解释”。一次性塞入过多资料导致信息遗漏。资料超过索引限制时模型对前面文件里的细节就会模糊。我的经验是文本总量控制在 2 万 tokens 以内超过就分两轮先全局扫一遍再针对高风险维度单独复查。图片压缩过度。压缩到长边 600 像素以下时角标文字基本看不清检查等于白做。1200 像素是个平衡点。忽略 PDF 的扫描质量。扫描版授权书如果不清晰模型会把“2025年”识别错成“2026年”引发过度报警。我建议扫描件先人工确认关键字段一次再加进资料包。过度相信模型的“查全”。模型在显式问题上召回率高在隐性一致性问题上可能漏。我的习惯是跑两遍第一遍用我上面那个完整模板第二遍换一个更聚焦的提示词只查跨文件一致性两轮结果合并去重。5.2 不想写代码怎么套用有人可能觉得这套东西门槛高实际上不写代码也能用。你需要一个支持多模态输入的对话式 AI 客户端把资料整理成 Markdown 格式图片压缩后上传然后把 3.1 小节的提示词模板复制进去等它输出 JSON再让它在对话里整理成表格展示就行。我推荐至少整理一份“字段清单”给它也就是把你资料包里每一份文件的字段名和含义写清楚。模型读懂了字段结构交叉比对的质量会明显上升。我自己试过有字段清单和没字段清单一致性问题的检出数量差了一倍多。如果要批量处理多个商品那就还是得写点脚本。核心流程就是遍历商品目录整理资料、压缩图片、拼提示词、调接口、解析 JSON、写报告。整个脚本不到两百行我后续打算把它做成一键运行的批处理工具给团队里不熟悉技术的同事用。5.3 还要保留人工那些环节最后说一个容易被忽略的点。模型体检是“查风险”不是“拍板”。它标出来的问题都需要人工确认一遍尤其是两类一类是高严重但低置信度的问题。比如“疑似未授权品牌logo”模型可能是看到主图角落有一个苹果logo形状的图案就报警了实际那只是背景里的装饰物。这种必须人工看图确认。另一类是涉及主观判断的内容。模型只能判断“这个卖点没有证据支撑”但不能判断“这个卖点应不应该保留”。运营的核心诉求、市场定位、品牌策略模型不懂人也别指望它懂。我在实际使用中还会把体检结果和平台的规则变动挂钩。平台规则不是一成不变的隔几个月就有新的规范出来。我每次跑体检前会先把这个阶段平台的新规摘要塞进提示词的检查维度区让模型按最新标准查。这一招比频繁更新工具本身方便得多。这套体检助手我用到现在最大的感受不是“AI 多能干”而是它把一件重复、琐碎、容易漏的事变成了标准流程。以前上架一个品我要花半小时到一小时去对资料现在 5 分钟出报告剩下的事情是按报告逐条确认和修改。省下来的时间我可以拿来盯真正的运营决策比如主图要不要换、活动定价怎么调。最后再分享一个小技巧不要把你的提示词模板锁死。我每次跑完一批商品都会把模型误报和漏报的案例追加进提示词里比如“注意纯棉描述如果没有检测数据支撑要单独标出来”。这样模板会越用越顺手体检的准确率也会一轮比一轮高。如果你也在被商品资料审核折磨不妨拿一个品试试大概率会回不去人工对表的时代。