你给一群人发一种药,最后发现平均病程几乎没变。这个结论听起来像“药没用”,却可能漏掉两种完全不同的现实:一种是有人明显好转、有人同等程度变差;另一种是少数人获得很大收益,多数人反而略受损。平均数会把这些差异压成同一个数字。
Gregor Steiner 和 Mark Steel 的论文把问题从“平均改善多少”换成“如果接受或不接受干预,结果会怎样分布”。他们用鞅后验(martingale posterior)估计完整的反事实结果分布,同时表达我们对密度、分布函数和分位数等结论有多大把握。论文还把方法扩展到条件分布和工具变量场景,并给出了相应的收敛结果。
平均值为什么不够
反事实,指同一个人在另一种处理下本会出现的结果。一个服药者如果没有服药,病程会持续多久,就是他的反事实结果。问题在于,每个人只能走一条现实路径。另一条路径看不见,只能借助数据和因果假设推断。
传统研究常报告平均处理效应,也就是比较接受与不接受干预时总体结果的平均差。它适合回答“整体上有没有改善”,却看不出变化落在分布的什么位置。
论文举出两类容易被平均数掩盖的情况。第一类中,干预使一部分人受益,同时让另一部分人受到幅度相当的损害,平均效果仍可能为零。第二类更像一张彩票:干预提高了出现极端好结果的概率,却降低了多数人的结果,平均值也可能没有变化。
完整分布能把这两种情况区分开。研究者可以看密度——各种结果出现得有多集中;看累积分布函数——结果不超过某个数值的概率;也可以看分位数——中位位置、较低位置或上尾分别发生了什么。分位数效应比较两种处理下相同分位位置的差异,因此能显示干预主要改变了典型人群,还是结果较差或较好的一端。
但边界也要说清:两种处理各自的边际分布,通常不能直接告诉我们“同一个人”究竟会受益还是受损。它展示的是两种潜在结果在人群中的分布差异,不是自动识别出的个人命运配对。
它换了一种构造后验的办法
通常的贝叶斯推断会先写下一个概率模型和先验,再用观测数据更新参数。鞅后验换了一个入口:它直接规定“下一条数据应该怎样预测”,然后把尚未观察到的数据一条条向前生成。每生成一条,预测规则就随之更新。
可以把它理解成不断续写一份尚未完成的人群名册。研究者从现有样本出发,按当前规则补出下一人,再把这个新成员纳入信息,继续补下一人。完成一次续写,就得到一个可能的总体分布;重复许多次,便形成目标量的后验分布。这里的“后验”表达的是认知不确定性——数据有限时,我们对真实分布还拿不准多少。
关键约束是,这套连续预测不能一路漂走。论文借助“几乎条件同分布”随机变量的概念,证明在文中考虑的因果模型和相应正则条件下,递推得到的反事实分布会收敛到定义良好的随机极限。这个结果不是装饰:如果递推不稳定,生成出来的所谓后验样本就未必代表一个协调的概率分布。
论文采用受 Dirichlet process mixture model 启发的非参数 copula 递推。非参数并不是“没有模型”,而是不先把结果分布锁进某个狭窄的固定形状。Copula 在这里帮助递推连续结果的条件分布。作者因此强调,该方法较少依赖严格的参数分布假设;这不等于它能抵御混杂、识别假设失效或所有模型错误。
从观察数据走到干预世界
因果推断还有一道额外难题:数据记录的是现实中谁接受了什么处理,而研究者想问的是主动把处理设为某个值后会发生什么。两者不是天然相同。
论文先学习观察数据的预测分布,把它拆成三部分:给定处理和协变量时的结果分布、处理分配机制,以及协变量本身的分布。协变量是年龄、健康状况等同时与处理和结果有关的已观察特征。随后,方法把条件结果分布在协变量人群上求平均,得到每个处理水平对应的反事实分布。
这一步依赖三项常见但重要的假设。其一是一致性:一个人实际接受某种处理后观察到的结果,就是该处理下的潜在结果。其二是无混杂:控制已观察协变量后,处理分配与潜在结果独立。其三是重叠:每类协变量人群都有机会接受各个处理。数据本身不能自动保证这些条件成立。
同一套框架既能估计总体的边际反事实分布,也能固定某些协变量,查看特定群体的条件分布。它还支持 S-Learner 和 T-Learner 两种组织方式:前者用一个模型共同学习处理组与对照组,可以共享信息;后者为两组分别拟合,形状更自由,但不能跨组借力,处理类别增多时计算也更重。
不只给一条曲线
这项工作的实用价值,在于一次后验采样可以服务多个问题。研究者可以从同一批反事实分布样本中读取密度和累积分布函数,也可以通过反转分布函数得到分位数,再计算分位数处理效应。不同目标的不确定性来自同一套后验样本,因此彼此协调,不必为每个指标重新搭一套推断程序。
模拟实验中,作者考察了偏斜分布和更难估计的双峰分布。文中报告,预测递推的距离轨迹都趋于稳定。第一种情景里,S-Learner 较好地逼近真实反事实分布,T-Learner 对对照结果略显过度自信;双峰情景里,T-Learner 给出的可信区间更窄,尤其是在双峰处理分布上。用 logistic treatment model 或 Bayesian bootstrap 重采样处理,两种选择对后验结果影响很小。这些是论文在模拟设置中的展示,并不构成对所有替代方法的普遍优势证明。
真实数据部分包括三个案例:锌含片对普通感冒病程的影响、存在单边不依从时维生素 A 补充对儿童生存率的影响,以及职业培训的效果。
锌含片案例最能说明分布视角为何有用。论文分析多项随机、双盲、安慰剂对照试验的数据,发现治疗组的病程分布中心更低,也更集中;对照组尾部更重。作者据此认为,原本可能经历最长病程的人获得的绝对收益更大。S-Learner 与 T-Learner 的结论大体一致,主要差别是后者对对照分布给出稍宽的可信区间。供稿文本中的具体分位数和天数在抓取时缺失,因此这里不补写数值。
工具变量也能接进来
当未观察混杂无法靠普通协变量调整解决时,论文把方法扩展到工具变量(instrumental variable,IV)设计。工具变量会影响一个人是否实际接受处理,但按假设不会绕过处理直接影响结果。
论文重点讨论二元工具、二元处理以及不依从的情形。人群可按“被分到处理组或对照组时是否会接受处理”分型,其中服从者会随分配改变实际处理。加入随机分配、排除限制和单调性假设后,方法可以识别并推断服从者的完整反事实分布,而不只是一项平均效应。论文还证明,只要服从者比例不逼近零等条件满足,这套递推会收敛。
这使分布推断能进入更棘手的现实场景:研究对象没有完全遵守随机分配时,研究者仍可询问干预怎样改变服从者群体的结果分布。不过,单调性——不存在与分配方向相反的“反服从者”——是一项实质性假设;加入协变量后,论文要求它在各协变量层内成立,条件更强。
为什么值得关注
这项工作的重点不是再造一个平均效应估计器,而是把因果问题的输出从一个数扩展成一整幅图,并让密度、分位数和其他派生指标共享同一套不确定性表达。对需要权衡异质性后果的决策而言,“平均有用”与“多数人受益”并不是同一句话,分布视角能让这种区别显形。
作者称实现“通常非常快”,并表示实证案例在数分钟内完成,递推序列之间可以并行,JAX 实现还能使用 GPU 加速。代码已公开在 CausalMP 仓库。不过,论文没有在供稿所含结果中给出统一的硬件、数据规模和系统性运行时间对比,因此不能据此断言它普遍快于现有方法。
局限与未知
- 结论依赖无混杂、重叠等识别假设;工具变量扩展还依赖随机分配、排除限制和单调性。灵活的非参数分布模型不能修复这些假设的违背。
- 完整边际反事实分布能揭示分布差异,却通常不能单独判断同一个体会受益还是受损。把“分布异质性”直接说成“个体效应已识别”会越界。
- 收敛证明针对论文所研究的模型和正则条件。真实数据案例展示了方法如何使用,但不能替代独立验证,也不能证明它在所有反事实分布任务上优于现有方法。