多家机构一起训练模型时,一台机器传来的结果可能只有一部分出错。就像一份分组账本里只改坏了一栏,旧办法却可能把整份账本扔掉。对有限混合模型——用若干潜在人群解释混合数据的模型——这尤其棘手:各地给人群编号的顺序还可能不同,中央服务器必须先判断哪些结果说的是同一类人。
作者提出 CFMR。它把每台机器都轮流当作对齐模板,将各地成分归到对应类别,再计算每类中多数结果聚集的范围;总范围最小的模板会被选中。随后,系统按类别过滤离群结果,只丢掉可疑成分,而不是整台机器,最后再合并保留下来的信息。这个设计不要求事先知道各类受破坏的比例,也不增加通信。
论文证明,在每个成分的真实估计仍占多数、且至少一台机器完全可靠等条件下,CFMR可达到预先知道哪些成分真实时的“oracle rate”。作者称,Gaussian mixture 模拟和 CWRU 轴承数据实验中,它接近成分级 oracle;具体优势仍取决于论文设定的分离度与破坏条件。