监控一条数据流,难点不只是发现“平均值变了”。波动大小、分布形状也可能悄悄换挡,而且变化前没人知道该盯哪一种。传统检测器往往要预先设定记住多长的历史:记得太久,反应迟钝;忘得太快,又容易把短期噪声当成异常。
Jiang 和 Bodenham 提出一种自适应的在线核变点检测方法。核方法会把数据映射到更丰富的特征空间,让多种分布差异更容易显现。每来一个新观测,系统就用类似 Maximum Mean Discrepancy(MMD,一种衡量当前数据与历史分布差异的指标)的信号,通过梯度更新自动调节遗忘因子——也就是旧数据还保留多少影响。数据稳定时多记一些;新观测与过去不协调时,就更快放下旧历史。
最实用的一点是,这套表示和更新都采用递归计算,因此作者称其计算与存储开销不会随数据流长度增长。论文报告,它在模拟数据和真实基准数据上优于多种核方法;不过具体优势仍取决于论文的实验设置。