你想知道教育是否会减轻抑郁,却遇到一个棘手问题:家庭收入和抑郁评分都有人没填。更麻烦的是,不填并非碰巧。收入特别高或特别低的人可能不愿透露收入,抑郁较重的人也可能更少报告症状。此时,简单补上几个“合理值”,未必能还原教育的因果作用。
一篇题为《Identification and Estimation of Causal Estimands with Missing Not at Random Data》的 arXiv 预印本,把问题往前推了一步:先不急着选插补算法,而是问,在混杂变量和结果同时非随机缺失时,哪些因果效应仍能由观测数据唯一确定;确定之后,再谈怎样估计。
这项工作的结论和实验均来自作者 Ria、Islam 与 Latif 的同一篇预印本,尚无独立信源交叉验证。
插补之前,先问“答案存在吗”
这里的“非随机缺失”,英文是 Missing Not At Random,简称 MNAR。它指的是:即使已经考虑手头可见的信息,一个值是否缺失,仍可能取决于那个没有被看见的值本身。抑郁越重越不愿回答,就是典型直觉。
论文关注的第一个目标是平均处理效应(Average Treatment Effect,ATE)。它比较同一目标人群在“所有人都接受处理”和“所有人都不接受处理”两种反事实下的平均结果。现实中,一个人不可能同时经历两种情况,所以研究者必须依赖数据和假设来推断。
混杂变量会让这件事更难。它同时影响是否接受处理和最终结果。例如家庭财富既可能影响受教育程度,也可能影响抑郁状况。如果财富记录又有选择地缺失,教育效果就可能与原有家庭差异混在一起。
关键概念是“可识别性”:即使拥有无限多同类数据,现有观测和假设能不能把目标答案唯一确定。若多个完全不同的因果效应都能解释同一批观测数据,插补模型再复杂,也只是从这些可能答案中挑了一个,不能证明它就是正确答案。
这延续了本刊 9 月 3 日报道的原则:MNAR 数据应先检查目标分布能否识别。本期的新进展,是把问题推进到混杂变量和结果同时缺失的因果分析。
缺失模式也能提供线索
作者考察了三类用于 ATE 的 MNAR 机制,并为中介分析给出三类对应机制。不同机制规定了混杂变量、结果及其缺失状态之间可以怎样相互依赖。论文没有宣称任意 MNAR 问题都能解决;每一项识别结果都依赖明确的缺失机制、正值性以及“完备性条件”。
完备性可以粗略理解为:数据中的变化必须提供足够多、彼此独立的线索,才能排除多个同样说得通的答案。在离散变量的例子里,作者把识别问题写成一组线性方程。要唯一解出未知部分,对应矩阵必须有足够的秩。说白了,方程不能少于真正独立的未知信息,缺失模式也不能永远给出重复线索。
其中一个机制允许混杂变量是否缺失取决于它自身,并允许结果缺失与混杂变量的缺失状态相关。另一个机制利用结果缺失在不同混杂变量水平上的变化,间接识别看不见的部分。第三个机制分别允许结果缺失依赖结果自身、混杂变量缺失依赖混杂变量自身,但要求两边都满足相应的完备性条件;在离散情形下,论文还要求两者维度或类别数相同。
这一步才是论文真正值得关注的地方:它没有把“补值”当作起点,而是先说明缺失数据在什么结构下仍包含足够信息。
EM 负责计算,不负责创造答案
完成识别后,作者用 Expectation-Maximization(EM)算法估计模型。EM 是处理隐藏或缺失变量的迭代方法:先依据当前参数推算缺失部分的可能分布,再用这些推算更新参数,反复进行。
若混杂变量和结果都是二元变量,某位参与者两项都缺失时,算法会考虑四种可能组合,并为它们分配概率权重。若变量连续,所需积分通常没有闭式解,论文改用 fractional imputation,也就是生成若干候选值,再按权重近似计算。
但要分清两件事:EM 解决的是“怎样估计”,完备性和缺失机制假设解决的是“能否识别”。如果数据与假设不能唯一确定目标,EM 不会凭空补出识别能力。
不只问总效果,还问效果怎么发生
论文进一步讨论中介分析。中介变量是处理影响结果时经过的中间环节。例如教育可能通过健康状况影响抑郁。
作者把总效应拆成自然直接效应(Natural Direct Effect,NDE)和自然间接效应(Natural Indirect Effect,NIE):前者描述不经过指定中介的作用,后者描述沿该中介路径产生的作用。论文把此前的识别与 EM 估计框架扩展到这两个目标,但同样需要额外的因果假设、MNAR 机制假设和完备性条件。
模拟实验把该方法与完整案例分析,以及采用默认设置的链式方程多重插补 MICE 比较。完整案例分析只保留所有相关字段都齐全的人;多重插补则生成多份补全数据再合并估计。
按作者报告,在满足所考察机制和完备性条件的多数设置中,EM 估计接近无偏,而另外两种方法出现明显偏差。以论文一组中介效应模拟为例,NIE 的偏差分别为:完整案例 0.027、MICE −0.118、EM 0.004。不过这不是普遍胜利。在一个二元混杂变量、连续结果的设置中,变量维度不同,完备性条件被破坏,EM 也出现明显偏差;中介分析里观察到同样模式。
为什么值得关注
这篇论文提醒我们,“缺失值处理”不只是数据清洗。若目标是相关性描述,补值是否贴近数据也许是主要问题;若目标是因果效应,还必须先证明观测数据和附加假设足以锁定那个效应。
作者还把方法用于 2015—2016 年 NHANES 数据,分析教育对抑郁严重程度的影响,并把自报健康状况设为中介。样本为 20 岁及以上人群,其中高中毕业或以上 4,355 人、未完成高中 1,364 人。抑郁使用 0 至 27 分的 PHQ-9 量表衡量;收入贫困比和 PHQ-9 均有缺失,约 22% 的参与者至少一项不完整。遗憾的是,供稿截取部分没有给出最终效应估计,因此不能据此报告教育影响抑郁的幅度或方向。
局限与未知
- “不能只靠插补”不是说所有插补方法都无效。论文只比较了特定 MNAR 机制下的 EM、完整案例分析和默认设置的 MICE;优势不能外推到所有缺失场景。
- 模拟结果是作者自述。供稿没有完整呈现 ATE 表格中的偏差数值,也没有提供置信区间;计算量较高,因此作者没有用 bootstrap 估计标准误。
- NHANES 应用属于观察性分析。因果解释仍依赖混杂控制、缺失机制以及中介分析假设,不能仅凭这个案例认定教育与抑郁之间已经建立因果关系。