一个学生的成绩很反常,不代表他会改变整所学校的数据结论;反过来,有些成绩看着不离谱,却可能把模型的判断明显带偏。针对这类“学生嵌套在学校、重复测量嵌套在个人”的聚类数据,Jones、Campbell 与 Liu 提出 MEIOM,用来区分普通异常点和真正会改写拟合结果的影响点。
它最关键的一步,是不再只看残差——也就是实际结果与模型预测相差多少。MEIOM 还加入 SHAP 值:它把一次预测相对基准的变化,分摊给各个输入变量,用来观察某个样本怎样推动模型输出。方法分别在个体层和群组层组合 SHAP 与对应残差,再用 Normalizing Flow(一串可逆变换)把不同形状的数据映射到统一尺度,从而设定判断影响点的阈值。
这套思路不依赖某一种模型结构,论文将其用于线性模型、随机森林和梯度提升树,并允许参考分布由多个高斯成分组成,以适应多峰数据。值得注意的是,现有材料主要说明方法设计,未给出可在此引用的性能提升数字。