医生第一次看到算法警报,可能谨慎核对;用久了,却可能越来越依赖,也可能因警报太多而不再理会。问题在于,许多实验只比较“有算法”和“没算法”,忽略人的用法会随接触次数改变。Wang 和 Baiocchi 回顾的 274 项算法辅助随机试验中,只有 51 项(18.6%)处理了这种动态。
论文把要测的效果拆得更清楚:算法首次出现时是否有帮助、长期使用后是否形成习惯,以及停用后人是否留下了新技能。这里的“估计目标”就是实验究竟想回答哪一种效果。作者据此提出 stepped double wedge 设计:把参与者随机分入始终使用、始终不用,以及在不同时间开始或停止使用算法的组。这样既能观察适应过程,也能区分当下帮助与使用后的残留影响。
作者用模拟说明,常见的逐次随机分配设计,在自动化偏见、警报疲劳和逐渐学会合理依赖这三种情形下都会产生偏差。结论很实用:评估决策支持系统,不能只问第一次有没有用,还要问人用久之后会变成怎样的使用者。