做药物试验时,研究者常会参考受试者治疗前的年龄或病情,像比较两班成绩时先看入学水平。随机分组本身负责避免偏差;这些“协变量”则用来滤掉噪声,让置信区间更窄,提高统计功效——也就是在疗效确实存在时,更容易识别出来。
这篇论文讨论的关键转向,是从预先固定一种回归模型,走向数据自适应调整:让模型形式或变量用法根据试验数据决定,甚至采用机器学习。作者主张,这类分析仍可完整预先规定、透明且可复现,并对模型设错保持稳健;其目标更进一步,是保证调整后的精度不低于完全不调整,同时维持统计有效性和原本关注的因果效应。
这不是给机器学习开绿灯,而是在尝试划出监管可接受的护栏。论文目前聚焦结局缺失很少的随机试验,以及目标人群的平均治疗效果;所给材料未披露具体算法或数值实验,因此更适合把它看作一套最佳实践主张,而非已经由效果数字验证的统一方案。