临床预测+医学RAG=结构化EHR建模能力+医学大模型应用能力(六)

临床预测+医学RAG=结构化EHR建模能力+医学大模型应用能力(六)
第八篇 医学预测模型的全面评估8.1 区分度指标:AUROC, AUPRC, C-statistic8.1.1 为什么 AUC 不是全部在第六篇中,我们用 AUROC 作为模型性能的标尺,顺利筛选出了最优的 LightGBM 模型。但如果你读过医学预测建模的规范论文,会发现往往同时报告四五种指标,单凭一个 AUROC 是远远不够的。区分度(discrimination)仅仅回答了“模型能否把死亡患者和存活患者区分开”,但并没有告诉我们:模型输出的 0.82 风险概率,是否真的意味着有 82% 的患者会死亡?(需要校准度)如果我们要设定一个高风险警报阈值,这个阈值下的假阳性率和假阴性率是多少?(需要阈值相关指标)使用这个模型做临床决策,总体净获益是否比“全治”或“全不治”策略更高?(需要决策曲线分析)因此,一套完整的预测模型评估报告,必须包含区分度、校准度和临床有用性三个维度。这一节我们先完善区分度指标。8