给一批医院随机分配新方案时,大医院患者多,小医院患者少。若两类医院的结局或疗效本就不同,“平均每位患者受益多少”和“平均每家医院改善多少”便不是同一道题。前者让每个人权重相同,后者让每个医院权重相同。论文关注的正是信息性集群规模(ICS)——集群大小本身与结局或治疗效果有关。
作者指出,常用的线性混合效应模型(用于处理同一医院内患者相似性)和采用可交换相关结构的 GEE(广义估计方程),此时可能产生随数据变化的隐含权重,结果既不对应个体平均效应,也不对应集群平均效应。新方法 CS-g 做两步调整:把集群大小及其与治疗的交互项加入模型,再用 g-computation——分别预测接受和不接受处理时的平均结局——明确计算想回答的效应。
最关键的一点是,作者证明:只要采用与目标匹配的权重,即使相关结构、其他协变量乃至集群规模项的函数形式设错,CS-g 仍可一致估计相应效应;其估计量还与更复杂的稳健标准化方法在有限样本中完全等价。模拟覆盖连续和二元结局,作者报告其无偏且效率更高,但摘要未披露具体提升幅度。