先把顾客按消费记录自动分组,再检验各组是否真的不同,看起来顺理成章。问题在于,分组和提问都来自同一批数据:算法已经挑出了最显眼的差异,若检验时还把组别当成事先定好,显著性就可能被夸大。选择后推断(post-selection inference)正是把这次“先挑再验”也计入不确定性。
Javier González-Delgado 等人的工作把这套方法推进到有依赖的数据:时间序列、同一对象的重复记录,或彼此相关的特征,都不能当成互不相干的信息。论文指出,沿用只适合独立观测和简单协方差结构的方法,会失去对选择性第一类错误——实际无差异却误报有差异——的控制;其模拟中,偏离还会随特征维度增加。作者据此为一般依赖结构建立充分条件,并覆盖层次聚类和 k-means。
一个值得注意的细节是,先把相关性“洗掉”也不是通用补丁:论文展示,白化处理可能改变聚类结果,于是连待检验的问题都换了。这项工作的提醒很朴素:数据驱动得到的组,不能在后续检验里假装早已给定。