Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.089 — 2026-10-01
PAPER 约 7 分钟

替代指标何时会骗过实验团队

短期指标能让实验更快出结论,也可能更自信地答错。这项研究画出了效率与可靠性的边界。

你在测试一版新推荐页,长期留存还要等三个月,但一周活跃已经出来了。现在就拍板,还是继续等?产品团队常把一周活跃当作长期留存的替代指标——较快观察到、用来推测长期目标的短期结果。这样能提速,前提是它没有漏掉产品对长期结果的其他影响。

Zihao Chen 的论文系统比较了这种早判策略。研究覆盖 7 种估计量、11 种数据生成过程和 93 个模拟场景,共 514 个“方法—场景”组合,每个组合最多重复 2,000 次。它关注的不只是替代指标理想时能省多少样本,还包括部分中介、时间漂移、结果稀疏和按入组时间获得标签等常见失效情形。本文数字和结论均来自这篇论文,尚无独立信源交叉验证。

快答案越依赖什么?

论文讨论的基本场景是“滚动入组”:用户陆续进入实验,长期结果又要过一段时间才成熟。到预定复盘日,早期用户已有完整结果,后来的用户只有短期信号。比如一次邮件营销实验持续入组四周,以两周内是否购买为长期结果;在第 2.8 周复盘时,大致只有第一周入组者的购买窗口已经关闭,但所有人都有点击、访问或加购数据。

最激进的办法是 surrogate index,即“替代指标指数”。它先用已有长期结果的用户学习短期信号与长期结果的关系,再为所有人预测长期结果,最后比较实验组和对照组。直觉上,这像根据已经批改的一部分试卷总结评分规律,再给全部试卷估分。若规律可靠,所有人的短期数据都能派上用场,估计会更稳定。

但它依赖 surrogacy,也就是“替代关系成立”:在短期指标和实验前特征相同的条件下,实验处理本身不能再提供关于长期结果的额外信息。换句话说,新功能对长期结果的影响,必须被替代指标充分承接。

问题常出在“部分中介”。中介变量位于处理影响结果的路径中,例如新功能先提高使用频率,再影响续订。如果新功能还直接改变续订,或带来短期指标没有记录的副作用,替代指标就只看见了部分路径。此时 surrogate index 可能很精确,却精确地偏向错误答案。

不完全相信预测,也能利用预测

论文重点比较的另一类方法是 PPI++。PPI 是 prediction-powered inference,可理解为“预测辅助推断”:先用模型预测所有人的长期结果,再利用已经成熟的真实结果,估计并校正预测误差。它不要求预测模型永远正确;在标签完全随机缺失(MCAR,即哪些人的长期结果已获得与其特征和结果无关)时,固定预测器版本可在有限样本中保持无偏。论文实际采用交叉拟合——把数据分组,预测每个人时不用其自身结果训练模型——对应的保证是渐近有效,而不是精确的有限样本无偏。

这种谨慎有代价。论文报告,在替代关系成立的场景里,surrogate index 的效率提升较大;PPI 系列仍能获益,但增益较小,而且随着已有长期标签比例增加,优势会收窄。说白了,surrogate index 把预测当答案,PPI++ 把预测当草稿,再用真值纠错。

研究还比较了只用成熟结果的 labeled-only 基线、直接缩放短期指标的 naive surrogate、利用历史实验组合多个指标的 composite proxy、可处理观察概率模型的 AIPW,以及在两类估计之间自适应加权的 hybrid。论文同时给出固定预测器、全样本参数化下 PPI++ 的有限样本方差,以及交叉拟合时 surrogate index 与 PPI++ 的联合渐近分布。这些结果主要服务于一件实务小事:置信区间不能只计算预测值本身的波动,还要计入预测模型是从数据中学出来的不确定性。

检查没报警,不等于安全

论文设计了一个 Hausman-type diagnostic,即比较 surrogate index 与 PPI++ 是否出现超出随机波动的分歧。两者若明显不一致,替代关系可能已被破坏。

但研究发现了更棘手的“检测—伤害缺口”:在部分中介模拟中,存在一段违反程度,已经足以破坏 surrogate index 的 coverage,却又小到多数数据集无法检出。Coverage 是“重复做很多次实验时,置信区间包含真实效果的比例”;它崩塌意味着区间看似窄而可靠,实际上经常错过真值。

公开数据分析把这个问题具体化了。在 64,000 名客户的 Hillstrom 实验上,论文报告 surrogate index 有 24.9% 偏差,区间覆盖率为 7.2%,而诊断仅在 11% 的数据切分中拒绝替代假设。把两种估计量通过 Cauchy kernel 加权的 hybrid 也继承了 10.7% relative bias。不过材料没有说明这个相对偏差的参照基准、方向和不确定性区间。

在约 1,398 万用户的 Criteo 实验上,同类违反能够被检出。论文的子抽样显示,样本规模增大后,诊断能力才逐渐出现,而替代指标造成的伤害一直存在。这不是“大样本自动解决问题”,而是大样本终于让检查工具看见问题。

真正该改的是分析顺序

这项工作的价值不在于宣布某一种方法永远胜出,而是把“更快”和“更可信”的交换条件说清楚。团队不能只问短期指标预测长期结果有多准,还要问:标签为何缺失?用户构成是否随入组时间变化?处理是否可能绕过替代指标,直接影响长期结果?

论文建议,在标签随机缺失、每个实验组拥有足够长期结果、并采用固定预测器或合适交叉拟合时,预先指定使用精确方差的 PPI++ 作为主要分析;把分歧诊断当作警报,而不是有效性证书;再把 surrogate index 放进敏感性分析,观察结论在更强假设下会怎样变化。预先指定很重要,因为看到结果后再挑方法,会把另一层选择偏差带进实验。

这个建议也提醒团队:滚动入组未必天然满足随机缺失。若最早入组者与后来者不同,或效果随时间漂移,PPI++ 的设计保证同样可能失效。论文的漂移场景正显示了这一边界。

局限与未知

  • 所有效果数字、理论结论和工作流建议都来自同一篇论文。摘要与所给正文没有提供部分定性措辞的统一数值阈值,仍需代码复现或外部研究检验其普遍性。
  • PPI++ 也不是保险箱。在 Criteo 的稀有转化子样本中,样本量为 30,000 时,其经验覆盖率只有 85.0%;这一数字还需结合目标置信水平、重复次数和具体抽样设计解读。
  • Hillstrom 的 64,000 名客户和 Criteo 的约 1,398 万用户是数据集规模,不表示每项估计都使用了全部样本。诊断未报警只能说明证据不足,不能证明替代指标有效。

供稿材料 SOURCES — 1

← 返回 2026-10-01 · 数据板块