技术报告-InternVL3

技术报告-InternVL3
😊1. 介绍1.1链接:https://arxiv.org/pdf/2504.104791.2贡献1.2.1 视觉端:InternViT提供两种规格:InternViT-300M、InternViT-6B,输入统一切分为448×448图像块;(但是哪怕是 448x448,在patch=14的情况下,vision token = 32x32 = 1024 tokens)和MiniCPM-v4.5类似,将高像素图像进行切分,这样能不损耗图像的信息;1.2.2 桥接:两层 MLP两层随机初始化网络,作用是将视觉特征维度对齐LLM 输入维度,搭建视觉与文本的特征桥梁。1.2.3 语言模型端:LLM 语言主干可选两种基座:Qwen2.5 系列(0.5B/7B/14B/32B/72B)InternLM3-8B初始化只用基座预训练权重,不使用指令微调版权重。1.2.4 V2PE 可变视觉位置编码传统 VLM 对文本、视觉 token 统一步长 + 1计数,高分辨率 / 多图 / 长视频场景下视觉 token 极多,位置索引快速超限,长上下文性能崩盘。V2PE 改进规则: