视觉定位新标杆:EGM-Qwen3-VL-8B在RefCOCO benchmark上的突破性表现
📅 2026/7/20 18:49:52
👁️ 次浏览
视觉定位新标杆EGM-Qwen3-VL-8B在RefCOCO benchmark上的突破性表现【免费下载链接】EGM-8B项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8BEGM-Qwen3-VL-8B作为EGMEfficient Visual Grounding Language Models系列的旗舰模型在视觉定位领域实现了重大突破。该模型基于Qwen3-VL-8B-Thinking构建通过两阶段训练 pipeline监督微调SFT强化学习GRPO在RefCOCO基准测试中达到91.4的平均IoU较基础模型提升3.6个百分点同时保持高效推理性能。 核心性能突破RefCOCO基准测试结果ModelRefCOCO valRefCOCO test-ARefCOCO test-BRefCOCO valRefCOCO test-ARefCOCO test-BRefCOCOg valRefCOCOg testAvgQwen3-VL-8B-Thinking91.092.586.686.291.280.587.888.687.8EGM-Qwen3-VL-8B93.995.691.290.593.586.390.891.491.4Qwen3-VL-235B-A22B-Instruct90.494.682.286.492.178.590.590.588.2Qwen3-VL-235B-A22B-Thinking93.494.190.689.591.485.290.490.590.7这一成绩不仅超越了同尺寸的基础模型甚至优于参数量更大的Qwen3-VL-235B系列90.7平均IoU同时实现了5.9倍的推理速度提升737ms vs 4,320ms平均延迟。 技术创新点高效视觉定位机制小模型与大模型的视觉编码器通常相同性能差距主要源于文本理解能力的差异。研究表明62.8%的小模型错误源于复杂提示中的多关系描述理解不足。EGM通过生成大量中等质量的推理token成功匹配大模型生成少量高成本token的性能。两阶段训练流程SFT阶段使用专有VLM为视觉定位训练数据生成详细的思维链推理步骤基础模型在此数据上进行微调SFT checkpointnvidia/EGM-8B-SFTRL阶段应用GRPOGroup Relative Policy Optimization强化学习算法结合IoU和任务成功指标的奖励函数进一步提升定位精度⚡ 快速开始指南模型下载pip install -U huggingface_hub huggingface-cli download nvidia/EGM-8B --local-dir ./models/EGM-8B使用SGLang进行推理启动服务pip install sglang[all]0.5.5 python -m sglang.launch_server \ --model-path nvidia/EGM-8B \ --chat-templateqwen3-vl \ --port 30000发送视觉定位请求import openai import base64 client openai.Client(base_urlhttp://127.0.0.1:30000/v1, api_keyEMPTY) # 加载本地图片为base64格式 with open(example.jpg, rb) as f: image_base64 base64.b64encode(f.read()).decode(utf-8) response client.chat.completions.create( modelnvidia/EGM-8B, messages[ { role: user, content: [ {type: image_url, image_url: {url: fdata:image/jpeg;base64,{image_base64}}}, {type: text, text: Please provide the bounding box coordinate of the region this sentence describes: the person on the left.}, ], } ], temperature0.6, top_p0.95, max_tokens8192, ) print(response.choices[0].message.content) 模型架构组件详情架构Qwen3VLForConditionalGeneration文本隐藏层大小4096文本层数36注意力头数328个KV头文本中间层大小12,288视觉隐藏层大小1152视觉层数27patch大小16 x 16最大位置嵌入262,144词汇表大小151,936 引用article{zhan2026EGM, author {Zhan, Guanqi and Li, Changye and Liu, Zhijian and Lu, Yao and Wu, Yi and Han, Song and Zhu, Ligeng}, title {EGM: Efficient Visual Grounding Language Models}, booktitle {arXiv}, year {2026} } 致谢本项目受益于Qwen3-VL、InternVL、verl和verl-internvl等开源项目。通过结合高效的训练方法和创新的推理策略EGM-Qwen3-VL-8B为视觉定位任务树立了新的标杆证明了小模型在特定优化下可以媲美甚至超越大模型的性能同时保持更快的推理速度。这一突破为视觉定位技术的实际应用开辟了更广阔的前景。【免费下载链接】EGM-8B项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
一、模型初始化(2‑2 models.ipynb)1、两种初始化模型方式底层模型:ChatOpenAI,兼容 DeepSeek‑Chat、GPT‑4o 等遵循 OpenAI 协议的模型;配置文件统一放在 .env。# .env文件
OPENAI_API_KEYsk‑xxx
OPENAI_BASE_URLht…
📅 2026/7/20 18:49:51
博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…
📅 2026/7/20 18:49:51
博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…
📅 2026/7/20 18:49:51
昨天凌晨两点,我盯着屏幕上那堆乱码一样的英文文档,头发都快抓秃了。客户甩过来一份关于Geo Ken的技术参数表,说是急用,明天一早就要交差。我第一反应是打开翻译软件,结果出来的东西简直没法看,什么“地理肯”、“地质肯”,这翻译是认真的吗?那一刻我真想顺着网线过去问…
📅 2026/7/21 18:13:14
博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…
📅 2026/7/21 18:13:11
前言
金九银十招聘旺季马上就到了,不知道大家是否准备好了,面对金九银十的招聘旺季,如果没有精心准备那笔者认为那是对自己不负责任;就我们 Java 程序员来说,多数的公司总体上面试都是以自我介绍项目介绍项目细节/难点…
📅 2026/7/21 18:13:11
博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…
📅 2026/7/21 18:13:11
你是不是也曾经在终端前度过无数个深夜,对着黑底白字的命令行界面敲下各种指令?对于真正的程序员来说,命令行不仅是生产力工具,更是一种生活方式。但今天我们不谈那些严肃的生产环境工具,而是聊聊那些让编程生活更有趣…
📅 2026/7/21 18:13:11
Chronotrains:终极欧洲火车旅行等时线地图使用指南 【免费下载链接】chronotrains Shortest times between train stations in Europe 项目地址: https://gitcode.com/gh_mirrors/ch/chronotrains
Chronotrains是一款专注于展示欧洲火车站点间最短旅行时间的…
📅 2026/7/21 18:13:11
本文关键词:geo geo测试你是不是也遇到过这种奇葩事?明明你的网站内容写得比同行好,图片更清晰,甚至价格还更低,但在搜索结果里就是排不进去。特别是做本地生意的老板,那种看着隔壁老王明明啥也不是,却天天坐在收银台数钱的滋味,真的憋屈。我最近为了搞懂这个所谓的“地…
📅 2026/7/21 0:00:39
1. Octane Render与C4D的黄金组合:为什么选择这个方案?在三维创作领域,渲染器的选择往往决定了作品的最终呈现质量和工作效率。作为Cinema 4D(C4D)用户,Octane Render的GPU加速特性与实时预览功能ÿ…
📅 2026/7/21 0:00:41
1. GPMC接口设计:从硬件连接到软件配置的全局视角在嵌入式系统开发中,尤其是基于TI Sitara系列如AM263x这类高性能微控制器的项目里,外部存储器的扩展几乎是绕不开的一环。无论是存放大量非易失性代码的NOR Flash,还是作为高速数据…
📅 2026/7/21 0:00:41
1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…
📅 2026/7/21 1:04:03
1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…
📅 2026/7/21 1:04:03
更多请点击:
https://intelliparadigm.com
第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…
📅 2026/7/21 1:04:03
目录
第一步:选对模板,省心一半
第二步:打开扫码点餐功能
开启功能按钮
桌台管理与桌码生成
第三步:个性化设计,打造品牌感
调整点餐页面
设置点餐规则 你还在让顾客站着排队点餐吗?2025年ÿ…
📅 2026/7/21 7:04:23
在业务中快速构建一个能理解私有文档、准确回答专业问题的智能助手,是很多开发团队面临的共同挑战。传统方案往往需要从零开始搭建复杂的 RAG(检索增强生成)系统,涉及文档解析、向量化、检索、大模型调用等多个环节,整…
📅 2026/7/21 17:04:52
FAE放射组学分析工具:医学影像特征探索的完整解决方案 【免费下载链接】FAE FeAture Explorer 项目地址: https://gitcode.com/gh_mirrors/fae/FAE
你是否曾经面对海量医学影像数据感到无从下手?想要从CT、MRI等影像中提取有价值的定量特征&#…
📅 2026/7/21 5:04:16