给一群借款人排风险,模型也许仍能把更危险的人放在前面,却把每个人的违约概率都算低。就像天气预报还能排出哪天更容易下雨,但降雨概率整体失准。只复现代码、确认排序能力没有明显下降,并不能证明模型依然可靠。
这项研究把这种做法称为“镜像验证”——验证团队用相近数据和方法重跑开发流程,容易连同原模型的盲区一起复制。作者模拟零售信贷环境发生变化,并重复抽样500次。按作者报告,常用的区分度指标在全部重复实验中都保持在验收线以上,但模型平均低估约32%的PD(借款人在给定期限内违约的概率),95%置信区间为21%至42%。
作者随后组合五类互补测试,并用“多项证据相互印证”的规则判断失效;其自述结果是,这套方法能检出上述退化,在稳定数据上的误报率接近零。若按单笔贷款计算监管资本,一个10亿美元组合会出现约8.5%的资本缺口。核心提醒很直接:有效验证不是证明模型还能复现,而是主动追问环境变了以后,它会在哪里悄悄失准。