模型说“收入比职业更重要”,先别急着当真:如果两项本来就彼此相关,功劳可能被分错;即使排序看着清楚,差距也可能只是抽样波动。Agostino Gnasso 的新论文研究条件 Shapley 值——它在给特征分摊预测贡献时,按真实的条件关系补全缺失信息——并为这种重要性估计加入置信区间,用来判断差异能否与随机波动区分开。
论文最值得注意的一步,是修正计算过程自身带来的偏差。直接用同一批 Monte Carlo 随机样本——靠反复随机抽取近似复杂计算——估计条件平均值再计算平方损失,会产生向上偏差,作者称这是其实验中有限样本置信区间覆盖不足的唯一来源。新方法把随机样本拆成两个相互独立的子批次,再交叉计算平方损失,从而消除这项偏差;随后结合交叉拟合和半参数推断——只对数据结构作部分建模,同时保留标准误等正式统计推断——构造 Wald 置信区间。论文给出了渐近正态性与覆盖率保证,但这些结论依赖其列明的数据分布、误差和依赖结构估计条件。