实时数据管线像一条不停送货的传送带:模型刚学完上一批,下一批已经到了。麻烦是,某批数据可能因采集变化或异常值而“变味”;直接吞下会把结果带偏,整批扔掉又可能浪费其中仍有用的信息。Wei Cao 与 Shanshan Wang提出一套在线期望回归方法。期望回归可理解为对高估和低估施加不同惩罚,用来观察结果分布的不同部位,而不只看平均值。
这项工作的关键,是不再只有“收下或拒绝”两个选项。系统先用基于得分检验统计量的连续监测识别明显异常批次;面对差异较温和的批次,则按数据自适应分配权重,保留相容信息,同时削弱可疑部分。更新时只保存历史数据的低维摘要,无须反复读取全部记录。作者还引入 Huber 损失——对特别大的误差降低惩罚增速,以减少极端值和重尾误差的影响。作者称,模拟实验和临床数据分析显示该方法提升了异质批次下的估计准确性与稳健性;材料未提供具体提升幅度。