Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
PAPER 约 1 分钟

协变量平衡别只盯一个均值差

加权后均值相近,不代表两组真的可比;三种检验能继续追查分布与尾部差异。

两组人的平均年龄一样,不代表构成一样:一组可能大多在中年,另一组却集中在年轻和年长两端。因果分析也有类似陷阱。常用的标准化均值差——把两组均值之差按离散程度缩放——容易漏掉偏斜、多峰和尾部差异。Ariel Linden 把三种比较完整分布的检验扩展到加权数据,让经过加权的处理组与对照组也能接受这类检查。

三种工具各有侧重:KS 寻找两条分布曲线的最大差距;Cramér–von Mises 累计各处差距;Anderson–Darling(AD)尤其关注尾部。论文还用置换检验——反复打乱组别标签来建立随机参照——统一判断差异是否异常,而且不要求权重来自某种特定算法。

作者在四种模拟情景中测试了样本量从 1,000 到 4,000、权重波动较大的情况。结果显示,三种检验的误报率都接近预设水平;中央集中的差异由 KS 最敏感,尾部差异则由 AD 明显占优,分散在整体分布中的差异由 AD 和 Cramér–von Mises 表现相近,且都胜过 KS。作者因此建议把 AD 作为日常平衡检查的通用起点,但它仍只能检查已经测量到的协变量。


供稿材料 SOURCES — 1

← 返回 2026-07-30 · 数据板块