【论文学习】MICCAI 2025 || Gut-VLM:面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准

【论文学习】MICCAI 2025 || Gut-VLM:面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准
Gut-VLMHallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language ModelsMICCAI 2025Gut-VLM面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准构建一个同时保留“模型错误报告、错误位置标签和专家修正报告”的胃肠镜图文数据集并让视觉语言模型学习发现和纠正自己的幻觉。幻觉是指模型生成的描述看起来合理但与图像中的真实医学内容不一致。例如一张正常幽门图像模型可能生成图像中央存在红色异常。但医学专家查看图像后认为没有这种异常这句话就是幻觉。医学场景下这种错误尤其危险因为模型可能声称存在实际上不存在的息肉把正常组织描述为炎症错误描述病灶颜色或位置错误判断是否出血、感染错误描述异物或医疗器械。Gut-VLM数据集怎么构建论文使用 Kvasir-v2 胃肠镜数据集中的图像共标注了1816张第一阶段GPT-4o生成报告先让 GPT-4 Omni 根据每张胃肠镜图像生成诊断性描述。提示词要求报告覆盖12个医学问题包括解剖部位解剖标志物的颜色和位置异常区域的颜色和位置息肉数量是否存在炎症是否出血是否存在异物是否感染是否存在医疗器械。得到的是未经审核的模型报告其中可能同时包含正确句子和错误句子第二阶段专家识别和纠正幻觉4名胃肠科专家逐句审查GPT-4o报告。每个句子被标记为Non-hallucinated与图像一致Hallucinated包含与图像不一致的信息对于错误句子专家还需要提供正确版本。最终每张图像可能包含胃肠镜图像 ├── GPT-4o原始报告 ├── 每句话的幻觉标签 ├── 专家修正后的句子 └── 完整的专家修正报告论文发现GPT-4o生成的报告中只有30.39%的报告完全正确1.70%的报告所有句子都包含幻觉67.84%的报告同时包含正确句子和错误句子。也就是说接近70%的报告属于这种情况一部分内容正确 一部分内容错误这比整段报告完全错误更符合真实风险。因为混合型错误看起来更可信也更难检测。幻觉感知微调方法论文比较了两种训练方式普通微调普通方法只给模型看输入医学图像 目标专家修正后的正确报告模型只学习“正确答案是什么”不知道原模型曾经犯了什么错误。幻觉感知微调作者提出的方法输入医学图像 GPT生成的错误报告要求模型分两步输出第一步找出哪些句子存在幻觉 第二步把错误报告修正为正确报告。模型不仅要学习正确答案还要学习错误模式以及如何纠正错误测试了4个开源视觉语言模型LLaVA-1.6-7BQwen2-7BDeepSeek-7B-VLmPLUG-Owl-2B。训练设置Rank-8 LoRA训练5轮batch size 8学习率 (1x10^{-4})A100 GPU。比较三种模型Pretrained未经微调Finetuned普通正确报告微调Finetuned-H幻觉感知微调摘要视觉语言模型Vision-Language ModelsVLMs在医学领域正变得越来越普及它们能够弥合医学图像与临床语言之间的差距。现有VLM在理解医学图像和文本查询并生成详细的描述性医学诊断报告方面展现出了出色的能力。然而幻觉问题仍然是VLM面临的一项重要挑战。这里的“幻觉”是指模型生成与图像视觉内容不一致的描述。这一问题在医学领域可能造成尤为严重的后果。为了促进胃肠道GastrointestinalGI图像分析领域的VLM研究并深入研究模型幻觉问题我们构建了一个胃肠道图像—文本多模态数据集——Gut-VLM。该数据集通过一个两阶段流程构建。首先使用ChatGPT为Kvasir-v2数据集中的图像生成描述性医学报告。在这一过程中ChatGPT会产生一些带有幻觉或错误内容的文本。随后在第二阶段由医学专家对这些报告进行系统审查识别并纠正其中可能存在的不准确信息从而保证数据标注具有较高的质量和临床可靠性。与仅包含描述性文本的传统数据集不同Gut-VLM还提供了用于标识幻觉句子的标签以及这些错误句子所对应的修正内容。减少VLM幻觉的一种常见方法是在小规模、特定任务的数据集上对模型进行微调。然而我们利用所构建的数据集采取了一种不同的策略。我们并非仅仅对VLM进行微调使其生成医学文本报告而是训练模型检测并纠正幻觉。我们将这种方法称为“幻觉感知微调”hallucination-aware finetuning。实验结果表明与仅针对描述性报告生成进行微调相比幻觉感知微调能够取得更好的效果。此外我们还使用多种评价指标对多个当前先进的视觉语言模型进行了全面评估从而建立了一个相应的评测基准。GitHub代码仓库bhattarailab/Hallucination-Aware-VLM图一图1上图数据标注流程概览下图[左]来自Gut- VLM 的数据样本根据提示中提出的问题描述了底层条件展示了幻觉文本红色与修正后的文本绿色[右]该数据集中ChatGPT-4 Omni生成响应的统计结果。上半部分数据标注流程Kvasir-v2胃肠镜图像 医学提示词 ↓ GPT-4o生成报告 ↓ 得到可能含幻觉的描述 ↓ 胃肠科专家逐句检查 ↓ 修正后的报告 ↓ AI提取结构化诊断问答 ↓ 人工再次检查 ↓ 最终诊断问答标注左下部分一个具体错误案例图像是一张正常盲肠胃肠镜图像 提示词是请用一段文字描述该图像并回答下面列出的所有问题 GPT-4o原始输出这是一张正常盲肠的图像。图像中央存在一个小息肉颜色偏黄。解剖标志物为结肠内壁主要呈粉红色。没有观察到炎症、出血、感染、异物或医疗器械。其中红色文字是幻觉图像中央存在一个黄色的小息肉 但图像中实际上没有息肉。GPT-4o把正常的阑尾开口错误识别成了息肉。另一个错误是解剖标志物是结肠内壁主要呈粉红色 专家认为这里的解剖标志物描述不准确专家修正后的报告这是一张正常盲肠的图像。图像中央可见颜色偏黄的阑尾开口。该图像的解剖标志物是盲肠。未观察到炎症、出血、感染或异物也未发现医疗器械。图像中不存在息肉。中下部分12个诊断问题GPT-4o生成报告时需要覆盖12个问题主要包括图像属于哪一种解剖结构图像中是否存在解剖标志物解剖标志物是什么颜色图像中是否存在异常如果存在异常异常是什么颜色异常位于图像中的什么位置是否存在息肉如果有有多少个是否存在医疗器械如果有在哪里、有多少个是否存在炎症是否存在出血是否存在异物是否存在感染因此它不是让GPT-4o自由描述而是用固定问题约束报告内容。右上部分报告级统计数据集中共有1816份GPT-4o报告。报告类型数量比例含义All correct55230.39%所有句子均正确Hallucinated32约1.76%所有句子都包含幻觉Mixed Responses123267.84%同时包含正确和错误句子重要的发现只有约30%的报告完全正确约68%的报告是“正确信息与错误信息混合”。混合型错误最危险因为整篇报告不是明显胡说而是大部分内容正确 少数医学事实错误右下部分不同医学属性的准确率柱状图表示GPT-4o在不同类型问题上的准确率大致为解剖类别约50%最低异常或解剖标志物的颜色约85%位置约90%医学表现如炎症、出血、感染约90%息肉数量约80%。这说明错误不是均匀分布的GPT-4o对颜色、位置和部分医学表现判断较好但对具体解剖类别的识别明显较差。