ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

First, do NOHARM: towards clinically safe large language models

First, do NOHARM: towards clinically safe large language models 文章核心总结与创新点一、主要内容研究背景:大型语言模型(LLMs)已成为临床决策支持(CDS)中快速普及的工具,三分之二的美国医生正在使用,2025年预计超1亿美国人将接受使用该类工具的医生提供的诊疗服务。但LLMs的临床安全性缺乏系统评估,现有基准多聚焦医疗知识和诊断推理,未充分关注其输出对患者的实际伤害风险。核心基准构建:开发了NOHARM(Numerous Options Harm Assessment for Risk in Medicine)基准,基于100个真实的初级保健到专科咨询病例,覆盖10个医学专科,由29名董事会认证医生(含23名专科医生)对4249个临床管理选项进行12747条详细注释,标注每个选项的临床适当性(获益vs伤害)及伤害严重程度。关键研究发现:31款主流LLMs中,严重伤害发生率最高达22.2%(95%CI 21.6-22.8%),遗漏性伤害(未推荐必要诊疗行为)占严重错误的76.6%。LLM的安全性与现有AI或医学知识基准仅中度相关(r=0.61-0.64),模型参数、发布时间等常见指标无法可靠预测临床安全性。最优模型在安全性上优于全科医生(平均差异9.7%,95%CI 7.0-12.5%),多智能体协同方案(结合开源模型、专有模型和RAG系统)比单一模型减少8.0%的伤害。安全性与"克制性"(避免模棱两可诊疗建议的能力)呈倒U型关系,过度精准或过度宽松的模型均会降
返回列表