同一家供应商,网址可能带不同协议、子域名或拼写错误;但两家公司名字很像,也不能贸然合并。供应商去重就是这种两难:漏合并会拆散交易历史,错合并则可能污染付款和审计记录。
据 Towards Data Science 报道,这个案例构造了11,531行网站记录,对应7,180家真实供应商。先统一大小写、协议和路径,再识别可注册域名,两个确定性阶段就处理了约76%的重复记录。所谓“确定性”,就是规则清楚、结果可复核,不先猜两个名称“有多像”。
真正棘手的是剩余记录。案例用 RapidFuzz 计算字符串相似度——把两个名称有多像压成分数——却发现真假重复在88至97分明显重叠。阈值设为90时,自动合并的精确率只有76.4%,会错并282家;提高到98虽可避免错并,召回率却跌到50%以下。作者因此把1,905个含混候选交给人工复核,并主张让分数安排复核顺序,而不是替业务直接拍板。