Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.093 — 2026-10-05
PAPER H 21 约 7 分钟

CMH检验,原来也是一种AIPW

老牌CMH检验换个角度看:特定分层试验中,它的分子正是AIPW因果效应估计。

如果一项临床试验在多家医院进行,研究者通常不会把所有患者直接混在一起比较。不同医院的患者构成可能不同,治疗组和对照组也要先在各医院内部对照,再汇总结果。用了几十年的 Cochran–Mantel–Haenszel(CMH)检验,就是处理这类问题的经典工具。

但它常被教科书解释成一种“共同优势比”检验:先假定各层共享同一个优势比,再问这个比值是不是 1。Ekkehard Glimm 的这篇论文换了一个角度。作者指出,在二元终点、分层随机试验且每层采用相同治疗分配比例时,CMH 统计量的分子与 AIPW 估计量成比例。换句话说,这件老工具也能用现代因果推断的语言理解。

这里的结论有明确边界,且目前全部来自 Glimm 这篇 arXiv 论文,尚无第二个独立信源交叉印证。

它检验的,不只可以是优势比

先解释三个概念。

二元终点,是只有两种结果的指标,例如“有反应或无反应”。分层,是按研究中心、年龄段等类别先把受试者分组。CMH 检验则在各层内部比较治疗组和对照组,再把证据合并,避免不同层的人员构成直接混进总体比较。

平均处理效应(ATE)问的是另一个更直观的问题:假想同一总体中的所有人都接受治疗,再假想所有人都不接受治疗,两种情况下的平均结局相差多少。对二元结局来说,这可以写成平均因果风险差:

ATE=E{Y(1)−Y(0)}.

其中,Y(1) 表示接受治疗时的潜在结果,Y(0) 表示不接受治疗时的潜在结果。现实中,同一个人不可能同时展示两种结果,所以研究者要依靠随机分配来估计这个差。

论文证明,在每一层都固定采用同一治疗分配比例的分层随机试验中,CMH 统计量的分子,正比于各层风险差按层人数加权后的总体风险差。这个总体风险差正是在估计 ATE。

这改变了CMH检验的解释方式。研究者不必先相信“所有层共享一个优势比”的模型,才有理由使用它。至少在论文规定的试验设置里,CMH也可以被看作对总体平均因果风险差的检验。

AIPW为什么会出现在这里?

AIPW 是“增广逆概率加权”。名字很长,思路可以拆成两部分:一部分按照每个人接受治疗的概率加权;另一部分建立结局预测,用来校正不同人群之间的差异。两部分合在一起,构成随机试验和观察研究中常见的因果效应估计器。

论文采用了一个很具体的结局模型:每个“分层×治疗组”的小格子,都有自己独立、不受约束的反应率,不再加入其他协变量。作者指出,在这种设置下,AIPW 的增广校正项会精确抵消。原因是每一层的治疗分配已经固定,按层处理以后,不再有残余的治疗分配不平衡需要校正。

因此,两者不是只在大样本下逐渐接近。对每一个已经实现的样本,分层风险差估计与这里的 AIPW 点估计完全相同。CMH 分子再乘上由共同分配比例决定的系数,就得到同一个量。

不过,“CMH 原来也是一种 AIPW”只能算便于传播的简称。论文并没有说CMH与任意AIPW方法完全等价。它讨论的是二元结局、离散分层、层内固定且各层相同的治疗比例,以及一个特定的ATE估计。若试验只固定总体随机比例,没有在每一层内固定,有限样本中的精确对应就不再成立。作者只说,在常规条件下、各层实际比例逐渐接近目标时,两者仍会渐近等价;相应的完整方差分析不在本文范围内。

真正的分歧藏在分母里

如果点估计相同,CMH 与常见的 AIPW Wald 检验为什么还会给出不同判断?关键不在分子,而在用什么方差把分子标准化。

方差描述估计结果在重复试验中会波动多大。CMH采用条件方差:它把已经观察到的各层人数和各层总反应数当作固定,再计算治疗分配带来的波动。精确版本使用条件超几何分布;常见的大样本版本则使用相应的近似方差。

现代因果推断里的 Wald 型 AIPW 检验,通常更关心无条件方差。它把受试者看作从一个更大总体中抽来,因此也计入“这次恰好抽到多少名不同层受试者”的波动。若各层治疗效果不同,这部分随机构成会额外增加方差;只有各层风险差相同时,这个额外项才消失。

还有另一条独立的分界:方差是在零假设下合并估计,还是在不受限制的模型下分别估计。经典CMH使用条件、基于零假设的合并方差;常见AIPW Wald方法则多用不受限制的方差,有时还是面向总体重复抽样的无条件方差。直接比较两种检验,实际上同时混合了这两项差别。

论文因此没有宣称CMH必然更有力。不受限制的方差在备择情形下可能更小,让Wald统计量看起来更大。但当样本不多、分层很多,或者某些“分层×治疗组”格子人数很少、观察反应率接近0或1时,这种方差估计容易偏小,Wald检验可能变得过于激进。CMH的合并方差虽然可能更大,却往往更稳定。

“保守”也有严格前提

论文进一步区分了两类零假设。强零假设要求每一层都没有治疗效果。CMH在这种假设下可以控制第一类错误——也就是把无效治疗误判为有效的概率;使用精确条件分布时可以做精确检验。

弱零假设只要求总体ATE为零。此时,一些层受益、另一些层受损,两边可以相互抵消。论文指出,CMH在一般情况下并不总是这个弱零假设的有效水平检验。

一个重要例外是1:1等比例随机分配。作者推导并通过情景计算与模拟核对:在这种设置下,针对“平均处理效应为零”的弱零假设,CMH渐近保守。也就是说,样本足够大时,它的实际误报率不会超过设定水平;只要不同层的治疗效果并非处处相同,实际拒绝概率还可能低于名义水平。

这不能外推成“CMH永远保守”。论文明确说,治疗分配不等时,既能出现保守情形,也能出现偏激进的情形。

为什么这次重读值得关注

这篇论文的价值,不是发明了一个新检验,而是把两套统计语言接了起来。经典CMH通常从分层列联表和共同优势比出发;AIPW则从潜在结果、平均处理效应和协变量调整出发。论文说明,在一个常见而具体的随机试验设置里,两套语言指向了同一个点估计,主要差别落在推断时如何选择和估计方差。

这也提醒实验与临床团队:更现代的估计器,并不会自动带来更可靠的检验。点估计的渐近效率、有限样本中的方差稳定性,以及检验针对的究竟是强零假设还是弱零假设,是三件需要分开判断的事。CMH的吸引力不只来自年代久、使用广,也来自它在稀疏分层数据中较稳定的条件校准方式。

局限与未知

  • 结论依赖二元终点、分层随机试验,以及各层固定采用相同治疗分配比例;不能推广为CMH与所有AIPW估计或检验都等价。
  • 论文关于弱零假设下渐近保守的结论,专指1:1等比例分配。分配不等时,CMH可能保守,也可能偏激进。
  • 论文给出了理论推导,并称用大量情景计算和模拟作了核对,但没有在供稿所含正文中报告一套可供本文详细复述的完整模拟设计与结果表。

供稿材料 SOURCES — 1

← 返回 2026-10-05 · 数据板块