
如何快速测评 InternVL 科学图表理解能力ScienceQA 与 AI2D 完整评测指南【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVLInternVL是上海 AI Lab 推出的开源多模态大模型家族CVPR 2024 Oral其对话版本 InternVL-Chat 在多模态基准上逼近 GPT-4o。想验证模型看图做科学题的真实水平吗本指南带你用仓库内置的评测脚本快速完成ScienceQA 科学问答和AI2D 科学图表理解两大经典基准测试全程只需准备数据 一条命令。为什么选择 ScienceQA 与 AI2D 这两个基准这两个基准是检验多模态大模型科学图表理解能力的黄金标准分别覆盖不同侧重点基准测试内容题目形式评测指标 ScienceQAK-12 科学知识 配图的选择题单选A~E准确率 AI2D教材/科普中的示意图、流程图单选 图元定位准确率ScienceQA题目常配一张科学插图需要模型先读懂图再做逻辑推理例如物理受力分析图、生物结构示意图AI2DAI2Diagram由真实教学图表构建考察模型对图中元素、关系与文字标注的细粒度理解被 InternVL 技术报告列为核心对比项。 评测代码索引可参考 internvl_chat/eval/README.mdAI2D带 mask 版本使用的正是仓库内置的 VQA 评测管线。评测前必做环境准备清单✅ 确认已安装依赖pip install -r requirements/internvl_chat.txt✅ 下载模型权重如 InternVL2-8B 系列并放到本地目录评测时通过--checkpoint指向它。⚠️重要提示测试 InternVL 1.5 / 2.0 / 2.5 及更新版本时务必加上--dynamic参数启用动态高分辨率预处理否则成绩会明显偏低。ScienceQA 评测教程科学选择题理解测试第一步准备 ScienceQA 评测数据在internvl_chat/目录下创建数据文件夹按 internvl_chat/eval/scienceqa/README.md 中的说明准备最终目录结构应为data/scienceqa ├── images # 题目配图test.zip 解压 ├── problems.json # 原始题目 └── scienceqa_test_img.jsonl # 转换好的评测文件第二步一键运行 ScienceQA 评测在internvl_chat/目录下执行默认 8 卡并行GPUS8 sh evaluate.sh ${CHECKPOINT} scienceqa --dynamic脚本内部会调用 internvl_chat/evaluate.sh 启动多卡任务实际评测逻辑在 internvl_chat/eval/scienceqa/evaluate_scienceqa.py每道题会把配图支持动态分块、题干、选项拼成完整提问模型输出后自动按Final answer: / Answer: 正则提取答案并统计准确率。AI2D 评测教程科学图表理解能力测试第一步准备 AI2D 评测数据按照 internvl_chat/eval/vqa/README.md 中 AI2D 一节准备核心是下载转换文件test_vlmevalkit.jsonl与图片包AI2D_TEST.zip放到data/ai2diagram ├── test_vlmevalkit.jsonl └── AI2D_TEST # 图表图片第二步一键运行 AI2D 评测GPUS8 sh evaluate.sh ${CHECKPOINT} vqa-ai2d-test --dynamic该任务由 internvl_chat/eval/vqa/evaluate_vqa.py 驱动ai2diagram_test数据集配置了 accuracy 指标模型只需输出选项字母即可完成判分。关键参数速查3 个高频选项说明参数作用建议--dynamic动态高分辨率大图自动切块 缩略图保留细节1.5 以上版本必开--max-num动态切块数量上限默认 6细节密集的图表可适当调大--load-in-8bit8-bit 量化加载降低显存显存紧张时开启--auto大模型自动切分到多卡超大模型推荐结果解读与常见问题 运行结束后日志会输出各数据集的accuracy即答对题目占比。对比参考InternVL 技术报告中InternVL2 系列在 ScienceQAtest上已具备接近前沿闭源模型的得分AI2D 成绩随--max-num增大而提升。新手常见坑忘记--dynamic→ 高分辨率图表细节丢失分数偏低这是最常见的原因数据路径不对→ 评测脚本以internvl_chat/为工作目录data/必须建在其下GPU 数量不匹配→ 默认 8 卡卡数不同时请设置GPUSn或用--auto显存不足→ 加--load-in-8bit量化加载。写在最后掌握这套 ScienceQA AI2D 评测流程后你就不必依赖第三方框架也能像技术报告一样复现 InternVL 的科学图表理解成绩 。若想继续扩展仓库的internvl_chat/eval/目录下还内置了 MMMU、MathVista、ChartQA 等数十个基准的评测入口欢迎按同样的模式逐个解锁。【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考