两套临床模型的验证分数差不多,不等于它们会给同一位患者相近的风险判断。就像两份班级排名整体相似,某个学生的位置却可能差很多:汇总指标容易把个体层面的摇摆藏起来。这项研究用 GUSTO-I 试验的 40,830 名参与者数据预测 30 天死亡风险,比较了逻辑回归(LR)与人工神经网络(ANN)。
作者设置了六种样本量情景,每种都使用八个预测变量,并通过 200 次 bootstrap 重抽样——从原数据反复抽取训练样本——检查模型稳定性。最具体的发现是:LR 的区分度在 EPV 达到 44.50 时已经稳定,但个体预测要到 EPV 89.12 才稳定。EPV 指每个候选变量大致能分到多少次死亡事件;区分度则衡量模型能否把更高风险者排在前面。ANN 要求更高,其区分度的乐观偏差到 EPV 178.25 才稳定,在 EPV 4.50 时预测还出现严重校准偏差。换句话说,生产评测不能只看总体排名指标,还应报告同一个人的预测会不会随训练样本变化而跳动;这些结论目前来自作者的论文分析。