ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

10个实用Prompt技巧:快速玩转CogVLM的Chat、Grounding与Agent三大任务模式

10个实用Prompt技巧:快速玩转CogVLM的Chat、Grounding与Agent三大任务模式 10个实用Prompt技巧快速玩转CogVLM的Chat、Grounding与Agent三大任务模式【免费下载链接】CogVLM-codea state-of-the-art-level open visual language model | 多模态预训练模型项目地址: https://gitcode.com/zai-org/CogVLM-codeCogVLM 是智谱AI开源的强大视觉语言模型VLM支持图像理解、多轮对话、视觉定位Grounding和 GUI Agent 能力。这篇文章通过10个实用Prompt技巧带你快速玩转 CogVLM 的 Chat、Grounding 与 Agent 三大任务模式即使新手也能上手写出高效的提示词。 3分钟启动 CogVLM在体验 Prompt 技巧前先跑起来。CogVLM 仓库zai-org/CogVLM-code自带命令行与 Web 两种演示入口pip install -r requirements.txt python -m spacy download en_core_web_sm然后在 basic_demo/ 目录下启动# 命令行交互SAT 版 python basic_demo/cli_demo_sat.py --from_pretrained cogagent-chat --version chat --bf16 --stream_chat # 网页交互Gradio python basic_demo/web_demo.py --from_pretrained cogagent-chat --version chat --bf16 显存不够把--bf16换成--fp16 --quant 4即可 4-bit 量化单张 24G 显卡即可推理CogAgent 约 12.6GB。下图是 Web 演示界面上传图片后直接输入 Prompt 即可对话先搞懂--version参数不同模型对应不同的 Prompt 文本模板模型名--versioncogagent-chatchatcogagent-vqa / cogvlm-chat / cogvlm-chat-v1.1chat_oldcogvlm-grounding-generalist / cogvlm-basebase Chat 模式多轮对话的 4 个技巧技巧 1-4CogVLM 的 Chat 模式支持高分辨率490×490 起CogAgent 可达 1120×1120图像理解与多轮视觉对话幻觉少、细节捕捉强。技巧 1直接说人话通用对话零门槛官方 Cookbook 明确通用多轮对话下Say whatever you want——不需要特殊格式直接用自然语言提问即可这张照片里的人在做什么他为什么笑技巧 2一次只问一件事指明对象VLM 的注意力有限把大任务拆小。比起全面分析这张图更有效的是描述图中左侧那位穿红衣服的人的表情和动作。技巧 3多轮对话善用指代词Chat 模式保留对话历史后续轮次直接用它上面那个第二张图等指代模型能正确理解上下文输入clearCLI 中可清空历史重新开始。技巧 4按任务选对模型cogagent-chat通用多轮对话 GUI Agent Grounding 全能选手--version chatcogvlm-chat-v1.1多轮聊天与 VQA 均衡版本--version chat_oldcogagent-vqa单轮视觉问答更强适合 VQA 基准评测 Grounding 模式视觉定位的 3 个技巧技巧 5-7CogVLM 的 Grounding视觉定位能看懂图中物体的精确位置支持三种玩法。技巧 5先记住坐标格式[[x1,y1,x2,y2]]模型输入和输出的边界框都是千分位相对坐标原点在左上角x 轴向右、y 轴向下(x1,y1)与(x2,y2)分别是左上角和右下角数值是相对坐标 ×1000不足三位补零。例如[[212,498,787,564]]。技巧 6caption2box —— 用文字描述指出物体把expr替换成物体描述让模型返回坐标完整模板见 utils/utils/template.py#L345Can you point outchildren in blue T-shirtsin the image and provide the bounding boxes of their location?技巧 7box2caption / caption_with_box —— 坐标与描述双向互转box2caption坐标→描述把objs换成坐标询问框内内容见 utils/utils/template.py#L400Tell me what you see within the designated area[[086,540,400,760]]in the picture.caption_with_box描述→全图带坐标让模型描述图片并为每个物体附上坐标见 utils/utils/template.py#L537Can you provide a description of the image and include the coordinates [[x0,y0,x1,y1]] for each mentioned object?三种模式配合使用可以实现看图说话 → 定位物体 → 反查坐标内容的完整闭环⚠️ Grounding 请使用cogvlm-grounding-generalist或 cogagent-chat模型并配合--version base。 Agent 模式GUI 智能体的 3 个技巧技巧 8-10CogAgent 在 CogVLM 基础上增加了GUI Agent 能力给它任何一张网页、PC 应用或手机 App 截图它都能返回任务计划Plan、下一步动作Next Action甚至具体操作坐标。技巧 8套用 Agent 模板任务用双引号括起来从 Agent 模板中任选一句把TASK替换为双引号包裹的任务指令模板见 utils/utils/template.py#L761What steps do I need to take toSearch for CogVLM?模型将输出Plan: 1. Type CogVLM into the Google search bar. 2. Review the search results… Next Action: Move the cursor to the search bar, and type CogVLM.技巧 9句尾加(with grounding)拿到操作坐标What steps do I need to take toSearch for CogVLM? (with grounding)输出会追加带坐标的正式化动作Grounded Operation: [combobox] Search - TYPE: CogVLM at the box [[212,498,787,564]]坐标可直接用于自动化执行点击/输入。技巧 10每张截图只做单轮对话官方明确建议GUI Agent 任务下每张图像只进行单轮对话效果最佳——截图换了对话历史反而会干扰判断。想看完整实现逻辑可参考 composite_demo/demo_agent_cogagent.py 与 composite_demo/main.py。 加分项像调 GPT-4V 一样调用 CogVLM如果你熟悉 OpenAI 生态可以直接以OpenAI Vision API 格式接入 CogVLM迁移成本几乎为零启动服务端openai_demo/openai_api.py发起连续对话请求openai_demo/openai_api_request.py调参小贴士CLI 支持--temperature、--top_p、--top_k、--max_length控制生成过程——Grounding 任务建议调低 temperature 让坐标更稳定创意描述类任务可保持默认值。 总结任务模式核心 Prompt 公式推荐模型Chat自然语言直问一次一问多轮用指代cogagent-chat / cogvlm-chat-v1.1Groundingcaption2box / box2caption / caption_with_box 模板 [[x1,y1,x2,y2]]坐标cogvlm-grounding-generalistAgentAgent 模板 双引号任务 可选(with grounding)cogagent-chat记住这 10 个技巧配合仓库中的 README.md 与 basic_demo/ 脚本你就能把 CogVLM 从能聊图片用到自动操作 GUI。现在就去试试吧【免费下载链接】CogVLM-codea state-of-the-art-level open visual language model | 多模态预训练模型项目地址: https://gitcode.com/zai-org/CogVLM-code创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表