你想知道一项健康提醒对所有人有没有用,于是随机给一部分人发送提醒。但有人收到也不行动,有人没收到本来就会行动。最后,提醒真正改变行为的,只是一部分“会被推动的人”。传统工具变量分析通常能回答这群人的平均效果,却不能直接告诉你:如果把干预用于所有人,平均效果会怎样。
Zixuan Yao 与 Guosheng Yin 的论文试图跨过这道鸿沟。作者把近端因果推断引入工具变量分析,利用两组能够反映潜在人群差异的代理变量,纠正局部效果对“容易被推动者”的偏重。在论文设定的一系列假设下,这条路线可以识别总体平均处理效应。不过,目前证据全部来自这篇 arXiv 论文;材料没有提供同行评议、外部复现或可供比较的实证结果。
工具变量为什么只照亮一部分人?
工具变量(instrumental variable,IV)是一种用外部推动来研究因果关系的办法。这个推动会影响人们是否接受处理,但不能通过其他路径直接改变结果,而且要与结果背后的未观测原因独立。随机发送的健康提醒,就是一种容易理解的形式。
麻烦出在“不依从”。收到提醒的人未必行动,没收到的人也未必不行动。服从者(compliers)指那些会因为工具变量的变化而改变处理选择的人。二元工具变量——只有“有推动”和“无推动”两种状态——通常识别的是服从者的局部平均处理效应,即 LATE,而不是总体平均处理效应 ATE。ATE 问的是:如果总体每个人都接受处理,与每个人都不接受处理相比,平均结果相差多少。
如果不同人的处理效果相同,局部与总体之间的距离或许不大。真正棘手的是两种差异同时存在:人的处理效果不同,受工具变量推动的可能性也不同,而且两者受共同的潜在因素影响。比如,某类人既更容易响应提醒,也恰好更能从处理获益。此时,LATE 会有选择地放大这类人的效果。换句话说,工具变量照亮的并不是总体的一块随机切片。
论文把这种情况称为“同时异质性”。仅凭工具变量造成的变化,未必足以把服从者的效果外推到所有人。
不直接看见潜在差异,就找它的影子
作者换了一个角度:潜在因素虽然看不见,或许会在处理前留下可观察的“影子”。这些影子就是代理变量——它们不能直接等同于潜在因素,但携带与之相关的信息。
论文提出 proximal instrumental variable 框架。这里的 proximal causal inference,即近端因果推断,是一类借助代理变量恢复因果效应的方法。与标准近端方法不同,这篇论文中的代理变量主要刻画潜在的处理效果差异和依从差异,而不必承担典型“负对照变量”的全部角色。
框架使用两侧代理信息。一侧对应处理效果的潜在差异,作者用 outcome bridge(结果桥函数)连接它与可观察数据;另一侧对应人们服从工具变量的概率,用 compliance bridge(依从桥函数)表示潜在依从概率的倒数。桥函数可以理解为一套校准规则:研究者没有直接看到决定效果和依从性的潜在因素,却尝试通过它在两组代理变量上的投影,重建所需的总体平均量。
关键一步是把不可观察的潜在条件改写成只含观察数据的条件矩方程。论文证明,在工具变量有效、单调性、正值性、代理变量彼此分离以及桥函数存在等条件下,只要结果桥或依从桥中的一条成立,就能识别 ATE。桥函数本身甚至不一定需要唯一;目标效应仍可能是唯一的。
两座桥,给估计多留一条路
把两条桥结合起来,会得到 doubly robust representation,即“双重稳健表示”。这里的意思不是方法在任何情况下都稳健,而是:在论文规定的总体模型中,结果桥和依从桥只要有一侧正确,对应的增广表达式仍可无偏地指向 ATE;如果两边都有误,偏差由两边误差共同决定。
作者还处理了工具变量倾向概率——一个人在给定基线条件下获得某个工具变量取值的概率——已知和未知两种情况。前者可出现在随机鼓励实验中;后者需要从数据估计。论文分别推导了 efficient influence function(有效影响函数),也就是衡量每个观测对最终估计一阶影响、并用于构造理论上高效估计与置信区间的工具。
当倾向概率未知时,直接把估计值代入桥方程,会把估计误差直接传进去。作者因此设计了正交化条件矩,让前期误差主要以误差乘积而非一阶项进入结果。估计桥函数时,论文采用 regularized kernel minimax 方法:一个候选桥尝试满足条件,另一个“批评者”专门寻找它违反条件的地方;正则化则限制双方复杂度,缓解这类逆问题容易不稳定的困难。
最终的高效估计还采用 three-way sequential cross-fitting,即三路顺序交叉拟合。样本轮流承担三个互不重叠的任务:估计桥函数与其他辅助量、学习由桥函数生成的伪结果、评估最终得分。这样可以减少同一批数据既训练又验收带来的过拟合影响。
为什么值得关注?
这项工作的意义不在于宣布“工具变量现在可以回答所有人的效果”,而在于明确提出了一条新的外推路线。过去,从 LATE 走向更具总体意义的结论,往往要依赖已观测协变量能够解释人群差异,或者对处理效果与依从性之间的关系施加结构限制。这篇论文允许两者仍由共同的潜在因素驱动,再尝试用处理前代理信息补上工具变量缺失的那部分视野。
理论上,作者还给出了桥函数投影风险的界,并在相应条件下证明估计量具有渐近正态性和半参数效率。前者描述桥方程在相关方向上的估计误差;渐近正态性让大样本置信区间成为可能;半参数效率则表示,在论文规定的模型内,估计量达到相应的一阶方差下界。
局限与未知
- “从局部到总体”是有条件的识别结论。它依赖有效工具变量、单调性、正值性、合适的代理变量、代理分离、桥函数存在或可识别性,以及后续推断所需的完备性和正则条件。
- 代理变量是否真的充分反映共同的潜在异质性,通常无法仅凭方法名称保证。桥方程还是可能病态的逆问题,正则化能帮助估计,却不会自动让假设成立。
- 供稿虽包含数值实验的生成设定,但没有给出完整实验结果、样本规模、误差或覆盖率。因此目前不能据此声称该方法在实际数据中优于现有 IV 方法;双重稳健、渐近正态和半参数效率也只在论文规定的条件下成立。