Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.078 — 2026-09-20
PAPER 约 6 分钟

平行趋势过关,因果结论仍可能错

一篇新论文提醒:处理前走势一致,只是双重差分的起点;真正要问的是,换一种反事实后,结论会不会变。

你想判断一项新规是否影响就业。最常见的办法,是拿实行新规的城市和未实行的城市比较:先看两地政策前后的就业变化,再把两份变化相减。政策前,两地走势几乎一模一样,看起来很让人放心。但政策后,未实行新规的城市突然遭遇一场只影响当地的冲击。此时,继续拿它推测实行新规城市“如果没有新规会怎样”,答案仍可能偏掉。

这正是双重差分(Difference-in-Differences,DiD)的软肋。DiD 用控制组在处理后的变化,填补处理组看不见的反事实——也就是处理组若未接受政策、冲击或干预,本来会发生什么。这个填补依赖平行趋势假设:如果没有处理,两组结果本应以相同趋势变化。

研究者通常会先做前趋势检验,检查处理发生前两组的走势是否明显不同。但“没有检出差异”不等于证明两组未来仍会平行。Thomas Leavitt 在论文《Beyond Pretrends》中提出一种基于“不一致程度”的敏感性分析,追问得更直接:如果不用控制组,而用另一套同样说得通的办法填补反事实,估计结果会差多少?以下方法与案例结论均来自这篇论文,目前没有第二个独立信源或复现材料交叉验证。

两种填法,各有各的风险

标准 DiD 的做法,是把控制组在处理后的变化,当成处理组未受处理时的变化。它的好处是时间对得上:两份变化都发生在同一阶段。风险则来自组间差异。两组人员构成不同,或者政策后遭遇了不同冲击,控制组就可能不再是合适的参照。

另一种填法,是看处理组自己在处理前的变化,再假定这种变化会延续到处理后。它避开了组间构成差异,因为比较的是同一组人;代价是要相信不同时期足够相似。如果环境随时间改变,这个替代反事实也可能出错。

可以把它想成填纵横字谜。一个答案若只符合横向线索,却与纵向线索冲突,我们自然会降低信心。两条线索各有缺陷,但如果它们给出相同答案,结论就不那么依赖其中任何一条。论文把两种反事实填法给出的差距称为 discordance,即“不一致程度”。

关键不是假设像不像真,而是换掉它会怎样

这里需要区分两个问题。

第一个问题是:平行趋势假设有多可信?处理前走势相似,可能为它提供一些支持,但这种支持并不等于证明。

第二个问题是:结论有多依赖这个假设?即使平行趋势最终不成立,只要另一种合理填法给出的平均处理效应(Average Treatment Effect on the Treated,ATT,即处理对实际接受处理者的平均影响)几乎相同,原结论受到的影响也可能很小。反过来,如果两种填法差得很远,那么研究结论就高度押注于平行趋势。

Leavitt 的核心判断是:处理前趋势平行,是低敏感性的必要条件,但不是充分条件。换句话说,不一致程度很小,可以推出处理前趋势不会严重背离;但处理前趋势看起来平行,不能反推出不同反事实填法也会一致。

论文用一个风格化场景说明差别。两个案例拥有完全相同、而且完全平行的前趋势。第一个案例中,控制组原有趋势平稳延续到处理后。第二个案例中,控制组在处理后突然偏离自身前趋势。这次偏离可能是两组共同经历的冲击,也可能只发生在控制组。若是前者,控制组仍是更好的参照;若是后者,处理组自身的历史变化可能更合适。只看前趋势的敏感性分析无法区分这两个案例,因为它丢掉了控制组处理后的这条信息。

把分歧变成误差标尺

论文提出的 discordance-based sensitivity model,不再只用处理前两组走势的偏离校准风险。它把平行趋势填补与一组替代填补之间的距离,当作潜在误差的标尺。

敏感性分析不是简单宣布假设“真”或“假”,而是问:如果真实反事实偏离标准填补一定幅度,ATT 会落在什么范围内?论文用敏感性参数控制可容许偏差:参数越大,允许的反事实误差越大,ATT 的可能区间也越宽。

当存在多个替代填补时,研究者可以给它们分配权重,例如更重视临近处理时点的数据。但权重难免带入主观判断。Leavitt 因此采用最保守的做法:找到与平行趋势填补差距最大的那个替代值,用这份 worst-case discordance——最坏情况下的不一致程度——设定误差界限。

论文还给出两层形式化理由。第一,在替代假设至少有一定可信度的前提下,平行趋势下的 ATT 与替代假设下 ATT 距离越大,预期误差也越大。第二,从决策论看,把权重放在最大分歧处,可以最小化面对最不利反驳时的最大后悔;由此得到的 ATT 区间也是候选权重方案中最宽、最保守的区间。

这并不意味着“最不一致的替代填补一定更接近真相”。它表达的是另一件事:既然无法确认哪套反事实正确,就不要让一个较温和的权重选择掩盖潜在分歧。

为什么值得关注

这项工作的推进,在于把注意力从“处理前有没有露出破绽”,移到“处理后的反事实究竟可能错多少”。前趋势检查主要评估一条识别假设是否看起来可信;不一致分析则评估因果结论对这条假设的依赖程度。两者回答的不是同一个问题。

论文也没有声称所有通过前趋势检查的 DiD 研究都错了。更准确的说法是:通过检查不能单独保证结论稳健。若控制组处理后明显偏离自身历史走势,而不同填补方式又导向不同 ATT,只报告漂亮的前趋势就可能给人过多安全感。

作者把两类方法用于一个南非案例,研究一次劳动力供给冲击如何影响选民对种族隔离时期政策的支持。论文称,基于前趋势与基于不一致程度的敏感性分析得到不同结果。这说明两种诊断可能改变研究者对稳健性的判断,但材料没有给出效应量、置信区间和样本规模,也没有说明差异究竟是方向改变、显著性变化,还是区间宽度不同,因此不能把它扩写成原结论被推翻。

局限与未知

  • 论文关于现有前趋势方法可能低估敏感性的判断,是作者提出新模型的核心论证,目前没有独立研究或复现材料印证。
  • 替代填补只有在其背后的假设至少有一定可信度时才有解释力。一个完全站不住脚的替代假设,即使与标准结果一致,也不能增强结论。
  • 最坏不一致给出的是保守误差基准,不是对真实反事实的直接观测;它衡量结论可能有多依赖假设,而不是判定哪种填补必然正确。

供稿材料 SOURCES — 1

← 返回 2026-09-20 · 数据板块