ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

如何从零跑通 CLIP 零样本分类:从安装环境到第一次图文匹配

如何从零跑通 CLIP 零样本分类:从安装环境到第一次图文匹配 如何从零跑通 CLIP 零样本分类从安装环境到第一次图文匹配【免费下载链接】CLIPCLIP (Contrastive Language-Image Pretraining), Predict the most relevant text snippet given an image项目地址: https://gitcode.com/GitHub_Trending/cl/CLIP给定一张图片你想从一堆候选文字里挑出最贴切的那一条——CLIP 零样本分类干的就是这件事它把图像和文本映射到同一个向量空间里靠相似度大小就能判定最佳匹配不需要你训练任何样本。下面从搭环境开始到把模型跑起来、完成一次完整的零样本分类串成一个能独立复现的最小闭环。核心思路图像和文本住在同一套坐标系里一句话讲清原理后面所有代码都建立在这上面。图片和文字各自过一个编码器输出的是同维度的向量且落在同一个空间里所以给图找最匹配的文字和给句子找最接近的图是同一个动作算相似度、排序、取第一名。上图完整展示了这条链路——左侧是图文配对数据上的对比预训练阶段中间用标签文本拼出分类器右侧就是推理时直接做零样本预测的用法。4 步装好 CLIP 开发环境 ️5 分钟搭好环境后面所有代码都能直接跑。全程就四步唯一按硬件变化的是第二步的 PyTorch 安装命令。创建独立环境并激活避免依赖冲突conda create -n clip-env python3.8 -y conda activate clip-env按你的硬件选一条安装 PyTorch二选一必选硬件条件安装命令说明CUDA GPUconda install -c pytorch pytorch torchvision cudatoolkit11.3 -ycudatoolkit版本按驱动调整纯 CPU / macOSpip install torch torchvision --index-url https://download.pytorch.org/whl/cpu无需 cudatoolkit装项目其余依赖必选与 requirements.txt 保持一致pip install ftfy regex tqdm packaging获取仓库并以包的形式安装必选git clone https://gitcode.com/GitHub_Trending/cl/CLIP cd CLIP pip install .装完pip list里能看到clip、torch、ftfy环境这一关就算过了。15 行代码跑通图文打分 这一段是全文最短的代码跑通它你就拥有了一条可用的图文打分流水线。import torch import clip from PIL import Image device cuda if torch.cuda.is_available() else cpu model, preprocess clip.load(ViT-B/32, devicedevice) image preprocess(Image.open(CLIP.png)).unsqueeze(0).to(device) text clip.tokenize([a diagram, a dog, a cat]).to(device) with torch.no_grad(): logits_per_image, _ model(image, text) probs logits_per_image.softmax(dim-1).cpu().numpy() print(probs)预期输出只有一行[[0.9927937 0.00421068 0.00299572]]。第一个数接近 1、其余接近 0说明仓库自带的CLIP.png一张示意图被正确判给了 a diagram模型就是跑通了。两个细节先记一下clip.load返回模型和配套的预处理函数preprocess负责缩放、归一化两行就补齐了整条流水线clip.tokenize把文字切成固定 77 token 长度的序列短文本自动补 padding所以多条文本不用手动对齐。零样本分类实战从候选标签里挑出最佳项从能打分走到能分类这一步把候选标签换成一组更贴近真实业务的描述演示encode_image/encode_text两条编码路径的完整用法。思路是把图像和全部候选标签分别编码、归一化再算余弦相似度并 softmax 成概率分布——相似度前面乘的 100 是温度系数作用是把概率拉得更尖锐和官方示例口径一致。import torch import clip from PIL import Image device cuda if torch.cuda.is_available() else cpu model, preprocess clip.load(ViT-B/32, devicedevice) image preprocess(Image.open(CLIP.png)).unsqueeze(0).to(device) labels [a diagram, a photo of a dog, a photo of a cat, a screenshot] text torch.cat([clip.tokenize(t) for t in labels]).to(device) with torch.no_grad(): img_f model.encode_image(image) txt_f model.encode_text(text) img_f img_f / img_f.norm(dim-1, keepdimTrue) txt_f txt_f / txt_f.norm(dim-1, keepdimTrue) sim (100.0 * img_f txt_f.T).softmax(dim-1) print(labels[sim.argmax(dim-1).item()])理想结果是打印出a diagram并带着最高概率。注意这里没有调用model(image, text)联合接口而是走encode_*两条路——这在一批图对一批文的批量检索场景里更划算因为同一侧的向量可以算一次、复用多次。下一步可以试把labels换成你自己的业务文本原样重跑观察排序是否合理如果想看更标准的基准流程README 里还有一个 CIFAR-100 的零样本预测完整例子可以照着抄。踩坑速查安装和运行的高频报错 别急着怀疑人生先对表。下面 6 行覆盖安装、首次运行、显存、路径四类最常见的翻车现场。现象可能原因处理方式pip install .报ftfy、regex等缺失第 3 步依赖没装或装到了别的环境确认已conda activate clip-env重跑pip install ftfy regex tqdm packagingImportError: No module named torch当前 shell 不在装了 PyTorch 的环境里重新激活环境后用pip list核对首次运行长时间卡住无输出clip.load正在远程下载 ViT-B/32 权重数百 MB属正常现象网络差时先手动把权重放到~/.cache/clip/CUDA out of memory显存装不下当前模型或 batch换更小的RN50或调小批量、输入尺寸OSError: unable to open fileCLIP.png路径不对脚本不在仓库根目录图片与脚本放同一目录或改用绝对路径三项概率接近均分图片内容跟候选文本都不像属正常表现换一张与某条标签强相关的图再验证仓库关键文件与下一步行动 闭环已经打通接下来往哪儿走看这几份仓库内文件。README.md官方用法与完整 API 说明clip.available_models()、clip.load、clip.tokenize的签名都在这里clip/clip.py模型下载、加载、分词的核心实现想看权重缓存逻辑就翻它clip/model.py视觉编码器与文本编码器的结构定义model-card.md训练数据来源、已知偏差与局限用到生产前建议读一遍tests/test_consistency.py一个现成的最小验证脚本对比 JIT 与非 JIT 输出是否一致建议的下一步把上面实战代码里的labels换成你的业务文本保持 a photo of a ... 这类英文句式重跑一遍检查 top-1 排序是否符合预期如果排序明显跑偏先换一张真实拍摄的照片再试——CLIP 对文本措辞与图像风格的匹配相当敏感。【免费下载链接】CLIPCLIP (Contrastive Language-Image Pretraining), Predict the most relevant text snippet given an image项目地址: https://gitcode.com/GitHub_Trending/cl/CLIP创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表