天气预报说“明天最高温在 20 到 30℃之间”,容易猜中,却没多少用;若缩到 24 至 25℃,信息更足,也更容易落空。评价这类概率预测,难点正是同时看两件事:真实值是否落在预测区间内,以及区间是否足够窄。常用评分会把两者压成一个数字,方便排名,却可能让取舍不同的模型得到相近结果。
Milanesi 等人提出 IS–ROC 曲线:不断调节预测区间的松紧,把每种设置下的区间集中程度与预测误差画成一条曲线。这样,读者能直接看到模型在哪些取舍下更好,而不必先指定唯一偏好。论文还证明,由真实数据生成过程形成的曲线是凸的,并处在 Pareto 最优边界——也就是不牺牲一项目标,就无法改进另一项。
更实用的一步是模型集成:作者不直接混合整套预测分布,而是在曲线平面上取多个模型的凸包,也就是圈出它们能够组合出的有效外边界;校准则通过切线优化和凸化完成。论文以数值示例展示流程,但未报告大规模真实任务中的统一提升,因此它目前更像一套展开诊断信息的评估框架,而非新的冠军分数。