Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.061 — 2026-09-03
PAPER H 29 约 6 分钟

缺失非随机,插补前先问能否识别

MNAR 数据不是填上就好:先判断目标与完整分布能否从现有资料中识别。

你做一项收入调查,发现不少人没填收入。软件当然可以补上数字,甚至一次生成几十份“完整”数据。但如果高收入者更不愿回答,空白本身就和那个没被看到的收入有关。此时,程序能填,不代表资料足以告诉你该填什么。

这就是缺失非随机(Missing Not At Random,MNAR):一项数据是否缺失,仍与其未被观测的值有关。Juha Karvanen 与 Santtu Tikka 的论文把问题往前推了一步。面对 MNAR,不应先问“用哪种插补算法”,而应先问“我想恢复的分布,究竟能不能从现有资料中确定”。论文目前提供的是作者自己的理论论证与模拟结果,材料未说明同行评审状态。

能运行,不等于能识别

多重插补(Multiple Imputation)不是只把每个空格填一次。它会生成多份可能的完整数据,分别分析,再合并结果;不同版本之间的差异,用来反映缺失带来的不确定性。

问题在于,多做几次不会凭空增加信息。如果两套不同的数据生成机制能产生完全相同的已观测资料,却导向不同结论,这个结论就是“不可识别”的。再复杂的模型也只能借助额外假设,从多个可能答案中挑一个。

论文区分了两层对象。目标分布(target law)描述研究者真正关心的数据变量如何共同分布,例如收入、年龄和健康状况之间的关系。完整分布(full law)还把每一项是否缺失的指示变量算进去,也就是不仅解释数据是什么,还解释数据为何出现或消失。

这个区别很关键:最终分析也许只需要目标分布,但常规插补为了给每种缺失情况都填出正确的值,可能需要知道更大的完整分布。换句话说,插补索取的信息,可能比研究问题本身更多。

先查完整分布,再决定怎么填

论文给出的核心结论是:能够对所有缺失模式使用正确条件分布进行插补——作者称为“条件完备插补”(conditionally complete imputation)——当且仅当完整分布可识别。

“当且仅当”划出了一条清楚的边界。完整分布可识别时,理论上可以为每一种缺失组合构造正确的插补规则。MNAR 因而不等于“绝对不能做多重插补”:有些 MNAR 结构中,完整分布仍然可识别。

但这只是存在性结论,不是一键可用的配方。论文明确说,它不负责解决有限样本下如何估计这些分布。分析者仍要选择线性模型、预测均值匹配或随机森林等具体方法,还要决定插补次数和迭代设置。在 MNAR 情况下,插补模型通常还需要手动加入响应指示变量;常用软件未必默认这样做。

反过来,如果完整分布不可识别,就不存在覆盖所有缺失模式的条件完备插补。这里要谨慎理解:论文不是说“所有插补必然有偏”,而是说,在 MNAR、完整分布不可识别,并且方法仍试图实现条件完备插补这几个前提同时成立时,这类方法会产生有偏估计。

有时不必恢复整幅地图

更有意思的情况是:完整分布不可识别,目标分布却可能仍然可识别。好比无法还原每个人为何拒答,却仍有办法估计研究真正关心的变量关系。此时继续强求一份面面俱到的“完整数据”,反而走错了方向。

作者因此提出 factorizable imputation,可译作“可因子分解插补”。它先把目标分布拆成若干可识别的部分,再按特定变量顺序插补。其反直觉之处在于:某个较早变量一旦缺失,后续变量即使已经观测到,也可能先被改成缺失,再重新插补。这样会损失一部分信息,却能把杂乱的缺失状态整理成符合分解顺序的单调模式。

更一般的“条件可因子分解插补”还会先限制到某个子群体,在分析阶段给插补数据加权。权重用来补偿这种筛选,使拆开的分布成分重新组合成目标分布。论文也强调,这不是通用保证:它要求找到满足特定条件的变量分组和排序。变量一多,搜索排序与分区的最坏情况复杂度并非多项式级。

模拟说明了什么

作者用两变量和四变量的图模型展示这套决策方式。模拟数据采用正态变量与逻辑回归响应机制;每个例子生成一百万条观测,重点考察大样本偏差,而不是小样本波动。

在三组完整分布可识别的两变量例子中,加入响应指示变量的多重插补得到无偏估计;忽略响应指示变量的普通插补在这些 MNAR 模拟中始终有偏。在完整分布不可识别、但满足分解条件的例子中,factorizable imputation 得到无偏估计。

四变量实验给出了更清楚的边界:在前三个满足相应条件的例子里,factorizable imputation 无偏,其他比较方法有偏;第四个例子不满足该方法的条件,它也如预期产生偏差,不过按目标分布的识别公式直接估计,结果无偏或接近无偏。材料没有给出可可靠转述的具体偏差数值,因此这些结果只能说明模拟是否符合理论预期,不能据此比较实际应用中的效果大小。

为什么值得关注

这项工作的价值,不只是又提出一种插补方法。它重新安排了分析顺序:先描述自己愿意接受的缺失机制,再检查完整分布能否识别;若不能,再检查目标分布能否通过分解或其他识别公式恢复;只有这些问题回答清楚,才轮到软件和算法。

这也揭示了一个常见盲区:数据表被填满,只是计算流程完成了,不代表统计问题已经有唯一答案。可识别性检查像一道入口审查,把“模型成功运行”和“结论有资料依据”分开。

局限与未知

  • 理论假定插补模型设定正确,并暂不处理实际估计中的困难;完整分布可识别,也不自动保证有限样本估计无偏。
  • 实验证据来自作者设计的正态—逻辑回归模拟,样本量为一百万。材料未提供真实数据验证,也未给出可供本文引用的具体偏差数值。
  • factorizable imputation 的有效性依赖图模型、条件独立关系、变量排序或分区成立。材料不足以独立验证这些假设在现实任务中的适用范围。

供稿材料 SOURCES — 1

← 返回 2026-09-03 · 数据板块