同一种颜色,有人写“azure”,有人写“blue”;数据一汇总,它们就可能被当成两类。新发布到 CRAN 的 R 包 controller,想把这类清洗工作变成可重复执行的步骤:先在数据表中列出受控词表——一份获准使用的标准名称清单——再把原始写法映射到标准值,而不必把长串替换规则塞进代码。
作者 Joe Roe 给出的示例中,“daffodil”被改为“yellow”,“azure”和“navy”归入“blue”,“violet”归入“purple”;词表没有收录的“magenta”则保留原值并触发警告。包还支持忽略大小写及模糊匹配,用来应对空格、大小写和字符编码差异。更实用的是,它会报告哪些值被替换、哪些没有匹配,并提供 control_matches() 检查匹配过程。这让术语统一不再是分析者临时手改,而能进入数据流水线,每次更新都执行同一套可复核规则。当前是首个 CRAN 版本 v0.1.0,材料未提供真实项目中的准确率或效率评估。