EvoMDT:用于多癌种结构化临床决策的自进化多智能体系统文献速递/医学智能体前沿

EvoMDT:用于多癌种结构化临床决策的自进化多智能体系统文献速递/医学智能体前沿
2026.7.22本文提出EvoMDT以角色分工、证据检索、共识协调和自进化机制模拟肿瘤MDT在多癌种临床决策中提升可追溯性、效率和安全性。Title题目01EvoMDT用于多癌种结构化临床决策的自进化多智能体系统EvoMDT: a self-evolving multi-agent system for structured clinical decision-making in multi-cancer文献速递介绍02论文从精准肿瘤学的现实需求出发指出现代癌症治疗越来越依赖病灶级决策需要综合基因组、病理、影像、分期标准、器官功能、既往治疗和患者偏好等多源信息。传统MDT虽然是肿瘤决策的参考标准并与更好的指南依从性和生存获益相关但在病例量增长和专家资源不足的情况下常面临讨论时间压缩、推理过程隐性化、不同专科意见难以结构化记录等问题。既有规则型CDSS通常更像分期到治疗方案的查表系统能列举选项或提示禁忌却难以处理多条指南、纵向治疗线和多个合理方案之间的权衡单体LLM虽然表达流畅但缺少明确角色责任、安全闸门和可审计冲突解决机制。作者选择肝细胞癌、肺腺癌、淋巴瘤和乳腺癌作为代表性场景因为它们覆盖实体瘤与血液肿瘤、解剖分期与分子分型、肝功能约束、免疫与靶向治疗、围手术期管理和长期监测等不同复杂度。EvoMDT被定位为一种数字化肿瘤委员会通过专门智能体和协调机制将MDT的角色化推理、证据引用、安全优先和共识形成过程显式化。Aastract摘要03多学科肿瘤会诊是癌症诊疗的重要决策形式但现实中受专家资源不足、病例量增加、讨论时间有限和决策质量波动影响难以在所有场景中稳定提供可审计的高质量建议。本文提出EvoMDT一个自进化多智能体系统通过诊断、治疗、安全、监测和协调智能体分工协作结合病灶级结构化临床数据、混合检索增强生成和可追溯知识库生成带证据链的MDT式推荐。系统还能基于专家反馈和结果信号更新提示词、共识权重与检索范围以适应指南和临床证据变化。实验覆盖六个公开肿瘤相关医学问答基准、四个真实世界癌种数据集以及405例单盲医生评价结果显示EvoMDT在准确性、BERTScore、指南一致性、安全违规减少和响应时间方面优于多个前沿LLM基线并在医生评审中达到接近人类MDT的决策质量。Method方法04方法部分首先介绍泛癌种、病灶中心知识库的构建。该知识库不是简单文档库而是存储原子化推荐单元包括诊断和分期规则、治疗算法步骤、剂量和疗程、禁忌证、药物相互作用、器官功能限制和随访间隔并保留来源组织、版本年份、章节页码或表格锚点、版本哈希和更新时间。指南文本通过确定性解析器切分并规范化到ICD-10/11、TNM-8、RxNorm、ATC、CTCAE v5.0、RECIST和iRECIST等本体或标准。检索采用BM25与领域语义嵌入结合并辅以医学知识图谱若证据存在冲突则按安全优先、证据强度、辖区匹配和时效性进行仲裁。EvoMDT本身由五个智能体组成Diagnostic Agent负责贝叶斯诊断、分期和分子分型Treatment Agent负责多准则治疗优化、治疗排序和药物基因组学Safety Agent负责风险评分、药物相互作用、器官约束和禁忌筛查Monitoring Agent负责急性期、中期和长期监测Coordinator Agent负责加权共识、冲突检测和最终方案整合。每个智能体输出结构化JSON包括中间结论、置信度和证据列表协调智能体记录采纳或拒绝哪些方案、发生何种分歧以及安全优先的取舍理由。系统的自进化机制根据任务反馈持续优化智能体提示词、检索范围和工作流结构例如让某些智能体先列计划再执行或在复杂任务中增加协作与调整串并行流程。验证方法包括公开医学QA基准、四家三级医院405例回顾性真实病例以及五名肿瘤专科医生的单盲评分统计分析采用Mann–Whitney U检验、Kruskal–Wallis检验、FDR校正、Spearman相关和ICC一致性分析等。数据与代码可用性论文说明真实世界病例数据因隐私和保密限制不能公开但可在合理请求、相应审批和数据保护合规条件下向通讯作者获取。EvoMDT的核心模块和提示词已在GitHub公开地址为https://github.com/KesselZ/EvoMDT这有助于后续研究者进行复现、扩展和基准比较。Discussion讨论05讨论部分强调EvoMDT的核心贡献不是简单训练一个更强的语言模型而是提出了一种更接近临床治理需求的运行契约。与规则型CDSS相比它能表示多个合理治疗选项之间的权衡并保留可跨专科审查的理由与单体LLM相比它通过诊断、治疗、安全、监测和协调的角色分离将潜在分歧和安全约束显式化避免所有判断被压缩成一个不透明回答。三层验证体系分别评估了基础医学推理能力、真实世界多癌种迁移能力和医生认可的临床有用性。作者认为EvoMDT可作为资源受限地区或缺乏完整MDT团队医院的虚拟MDT辅助工具帮助预分诊、提高指南一致性、减少变异性并为监管审查提供证据链和版本记录。论文也承认若将其直接用于临床还需要人类医生审查与安全验证系统应辅助而非替代专业判断。Results结果06结果部分首先说明实验环境包括Ubuntu服务器、8块NVIDIA RTX 4090 GPU、Python 3.10、PyTorch 2.1.0和CUDA 12.1等配置并强调通过固定随机种子和版本控制保证复现性。在六个医学问答基准上EvoMDT在MedQA、MedQA-Cancer、MedMCQA-Cancer三个选择题数据集上分别达到0.86、0.89和0.75优于Llama3-70B、Claude-3和Med-PaLM 2等基线在MedQARo、MedQuAD和ROND三个生成式数据集上BERTScore达到0.66、0.63和0.68也处于最佳水平。作者进一步在乳腺癌、肝癌、肺癌和淋巴瘤四个真实世界数据集上验证模型虽然ROUGE分数较低约0.04到0.06反映表层词汇重合有限但语义相似度达到0.62到0.68说明模型能较好捕捉专家治疗逻辑。相对于随机打乱同癌种治疗方案的基线和明显错误的简单基线EvoMDT在AI评分、ROUGE召回和余弦相似度上均显著更高。单盲医生评价纳入405个标准化病例覆盖四类癌种EvoMDT综合均分为3.44处于五位医生评分的中上区间其中完整性和安全伦理两个维度均为3.68。其主要运行优势是时间生成完整MDT建议的中位时间为10.6分钟而五位医生为15.8到18.9分钟相当于缩短约30%到40%。代表性病例展示表明系统不仅给出与专家一致的治疗建议例如HBV相关肝硬化合并小肝癌病例中推荐腹腔镜肝切除联合恩替卡韦抗病毒治疗还能展示诊断、治疗、安全、监测和协调智能体如何分别贡献推理并整合为最终方案。Figure图07图1.该图概括了肿瘤MDT面临的核心矛盾指南、文献和患者数据快速增长而医生时间和认知带宽有限同时临床决策还要兼顾准确性、指南一致性、安全性和可执行性。中间部分比较了规则型CDSS、知识图谱、结构化EHR机器学习、单智能体LLM和朴素多智能体LLM的不足。右侧给出EvoMDT的差距到方案映射强调其通过本体约束RAG、安全智能体、协调共识、纵向监测、自进化和三层验证来弥补现有方法在证据基础、安全、共识、长期管理和持续改进方面的缺口。图2.该图展示EvoMDT在MedQA、MedQA-Cancer、MedMCQA-Cancer、MedQuAD、MedQARo和ROND六个基准上的表现。雷达图和柱状图均显示EvoMDT在选择题准确率和生成式回答的BERTScore上整体优于Llama3-70B、Claude-3和Med-PaLM 2。示例题中系统能识别环磷酰胺导致出血性膀胱炎说明其具备一定药理学推理和临床一致性。图3.该图比较EvoMDT在乳腺癌、肝癌、肺癌和淋巴瘤数据集上的ROUGE、语义相似度和AI综合评分。虽然ROUGE分数较低提示模型生成文本与专家答案表层表达并不完全一致但语义相似度和AI评分明显高于随机基线和简单错误基线说明EvoMDT能生成个体化且与专家治疗逻辑接近的方案。图4.该图从六个维度展示EvoMDT与医生评价结果包括安全伦理、效率、完整性、临床适宜性、证据利用和以患者为中心。EvoMDT综合评分位于医生中上水平完整性和安全伦理表现突出同时响应时间显著短于五位不同资历医生。ICC结果显示评分者间一致性较好相关矩阵提示六个维度相对独立支持评价框架的可靠性。图5该图用肝细胞癌、乳腺癌、肺腺癌和淋巴瘤代表病例展示EvoMDT如何根据结构化临床资料生成治疗推理并与专家参考方案对照。案例体现了系统在不同疾病语法下的适应性例如肝癌病例中结合肝硬化、病灶位置和病毒性肝炎背景给出手术及抗病毒建议肺腺癌和乳腺癌病例则体现分子标志物、分期和辅助治疗因素的整合。图6该图是论文最核心的方法架构图展示从多模态临床知识库到五智能体协作推理再到结构化MDT建议和多层性能验证的完整流程。知识库整合指南、文献和临床病例并使用SNOMED CT、ICD-10/11和RxNorm等标准化五个智能体分别负责诊断、治疗、安全、监测和协调最终输出包含诊断分期、治疗方案、安全评估、监测计划、证据引用和置信度并通过公开基准、真实患者验证和专家评分三层评估。