MicroVQA++: High-Quality Microscopy Reasoning Dataset with Weakly Supervised Graphs for Multimoda...

MicroVQA++: High-Quality Microscopy Reasoning Dataset with Weakly Supervised Graphs for Multimoda...
文章总结与翻译一、主要内容本文针对生物医学显微镜领域多模态大语言模型(MLLM)缺乏高质量大规模训练数据的问题,提出了MicroVQA++数据集及配套构建方法,核心内容如下:数据集构建背景:现有显微镜领域MLLM研究多聚焦硬件接口,科学推理能力受限,现有数据集(如MicroVQA)规模小(仅1042个测试样本)、高质量数据稀缺,无法满足模型微调需求。数据集构建流程:基于BIOMEDICA archive的显微镜图像-标题对,通过三阶段构建:阶段一:从同行评审文章中提取专家验证的图像-标题对作为初始监督源;阶段二:提出HiCQA-Graph异构图模型,融合自然语言推理(NLI)文本蕴含、CLIP视觉-语言对齐及智能体信号,过滤不一致样本;阶段三:利用MLLM智能体生成多选题(MCQ)并辅以人类筛选。数据集规模与特性:包含20000个训练样本和6000个人工校验测试样本,涵盖组织、细胞、亚细胞、原子等多尺度图像,以及光学、荧光、电子等多种成像模态,高难度Bloom级别问题占比显著高于现有基准。模型训练与效果:基于MicroVQA++微调后,仅40亿参数的开源MLLM(如InternVL3.5-4B-Instruct)在MicroVQA基准上达到GPT-5水平,成为开源模型中的当前最优,验证了高质量数据集对小参数量模型推理能力的提升