如果一种 HIV 治疗只在一场规模有限的随机试验里验证过,你可能会遇到一个尴尬局面:试验更可信,却未必有足够患者让人看清“它对谁更有效”;现实中的长期队列人数更多、随访更久,但医生为何给某位患者用药,往往又和病情有关。把两批数据直接混在一起,偏差可能跟着规模一起放大。
一篇 arXiv 预印本提出 Bayesian fusion forest(贝叶斯融合森林),试图把随机对照试验(RCT)的可信度与真实世界数据(RWD)的信息量放进同一个模型。它研究的是生存结局,也就是“死亡、复发等事件要多久发生”,并估计异质治疗效应——治疗效果怎样随年龄、病情等患者特征变化。作者是 Tijn Jacobs、Stéphanie L. van der Pas 和 Wessel N. van Wieringen。
本文的结果和效果判断均来自这篇预印本,尚无第二个独立信源可供交叉核验。
不是相信现实数据,而是给偏差留位置
随机分组能让治疗组和对照组原则上可比。现实世界里却不是这样:接受哪种治疗,可能取决于一些数据没有记录的因素。这叫未测混杂。例如,两组患者结局不同,原因可能不只是药物,也可能是某些未被记录的病情差异。
常见的数据融合难题,是要求现实数据满足“无混杂”假设。Bayesian fusion forest 换了一个条件:它允许现实数据含有未测混杂,但假设治疗效应可以在试验与现实数据之间迁移。所谓可迁移,是指控制已知患者特征后,同类患者的治疗效果在两种来源中一致;两批人的基础风险则可以不同。
这是一笔明确的交换。模型不再假装现实数据天然可靠,却必须相信试验识别出的治疗效应适用于现实数据中的可比患者。论文也指出,如果既允许现实数据存在未测混杂,又允许两边的治疗效应任意不同,两者便无法分别识别。现实数据再大,也解决不了这个结构性问题。
把四件事拆开算
模型采用加速失效时间模型(accelerated failure time model,AFT)。它不直接比较某一刻的事件发生率,而是描述治疗把生存时间按多大比例拉长或缩短。作者关注的指标叫加速因子:在生存时间分布的各个分位点上,治疗以一个乘数重新缩放时间。
在这个框架里,患者的对数生存时间被拆成四部分:
- 共享的基础预后,即不考虑治疗时,两批数据能够共同提供的信息;
- 来源特异偏差,用来容纳试验人群与现实队列在基础风险上的不同;
- 真正关心的治疗效应;
- 只作用于现实数据的混杂函数,用来表示现实观察到的组间差异与因果治疗效应之间的偏离。
可以把它想成整理两本账。共同项目放在共享账页,两批人的固有差异另开一栏,药物效果单列,现实数据里可能混进来的偏差也单列。这样做并不保证偏差已经被彻底清除,但至少没有把所有差异都冒充成治疗效果。
四个部分分别使用 BART(Bayesian additive regression trees,贝叶斯加性回归树)建模。它把许多较小的决策树叠加起来,可以自动表达非线性关系和变量之间的交互,不必预先规定“年龄与病情一定怎样共同起作用”。
作者还给不同部分安排了不同强度的约束。基础预后最灵活,因为每位患者都能为它提供信息;治疗效应受到更强约束,默认更接近人人相同,避免从小试验里轻易“发现”并不存在的亚组差异;混杂函数约束最强,优先接近一种不随患者特征大幅变化的统一偏差。共享基础预后负责借力,来源特异偏差则在两批数据确实不同时允许模型少借一些。
连“不知道事件何时发生”也一起处理
生存数据很少整整齐齐。随访结束时患者尚未发生事件,只能知道生存时间超过某个值,这叫右删失;如果患者只在定期检查时被发现发生了事件,我们只能知道事件落在两次检查之间,这叫区间删失。
Bayesian fusion forest 同时处理这两类情况。论文的应用中,试验数据是右删失,现实队列则包含区间删失。这一点很实际:若融合方法只能处理精确时间,就可能先把真实世界记录削成一种不自然的格式。
两种来源的误差形状也不必相同。论文使用 hierarchical Dirichlet process mixture(分层狄利克雷过程混合模型),让试验与现实数据拥有不同的误差分布,同时共享一些组成成分。说白了,它允许两批数据的噪声各有脾气,又不把它们当成毫无关系。
模拟里,借数据主要换来了更小的不确定性
作者进行了 1000 次蒙特卡洛重复模拟,每次拟合在 5000 次预热迭代后再抽取 5000 个后验样本。场景包含未测混杂、两来源基础预后差异、试验右删失和现实数据区间删失。
据论文报告,随着现实数据中的混杂增强,只用现实数据的估计偏差大致线性增加;只用试验的数据不受它影响,但精度受试验规模限制。融合模型在测试范围内保持近似无偏,均方根误差始终低于只用试验的基线,可信区间覆盖率接近设定水平,后验方差大约是试验单独分析的一半。
作者还把它与深度神经网络、梯度提升及两种 Buckley–James boosting 生存预测方法比较。论文称,融合森林在所测配置中取得最低均方根误差,也是唯一能以有竞争力的区间宽度达到名义覆盖率的方法。直接把两批数据简单合并的模型则会把现实数据的混杂偏差带进结果。这里的比较经过了适配,因为这些替代方法原本主要做预测,并非专门为因果数据融合设计。
当协变量维度增加、无关变量变多时,各方法精度都会下降。论文报告,融合模型的方差增长较温和,相对试验单独分析的后验方差仍维持在约一半。它的优势主要不是改变平均判断,而是缩小小试验带来的不确定性。
在 HIV 数据上,它给出了更明确的方向
实证分析把 ACTG 175 随机试验与 Multicenter AIDS Cohort Study 的长期队列数据结合起来,估计 HIV 联合抗逆转录病毒治疗的效果。论文称,融合分析识别出治疗对“几乎所有患者”有益,而只分析 ACTG 175 时结论不确定。
这正是该方法值得关注之处:现实数据不替代随机试验,也不被当成天然无偏的证据。试验负责锚定因果治疗效应,现实数据帮助描绘基础预后、延长观察信息,并提高异质效应估计的精度。对于“平均有效,但不知道谁更受益”的问题,这种分工比简单扩充样本更诚实。
局限与未知
- “混杂函数吸收偏差”是模型设定,不等于所有未测混杂都已被消除。结果依赖治疗效应能够跨来源迁移、两边患者具有足够重叠,以及模型设定合理。
- 该工作目前是预印本。材料没有提供同行评审、代码复现或外部验证情况;“几乎所有患者获益”也不应读成已经独立确认的临床结论。
- 供稿截取的应用部分没有给出样本量、效应量或可信区间。ACTG 175 与该队列的特定人群、年代和治疗背景,也可能限制结论向其他场景推广。