给 50 万张图片逐张贴标签,每张花 20 秒,总计就超过 2700 小时。主动学习(Active Learning)想解决的正是这类账单:模型先浏览未标注数据,只把最可能改善判断的样本交给人,再用新标签继续训练。它的价值不只是“少标一些”,而是让有限预算买到更有信息的人工判断。
Lucas Braga 介绍了三种选样办法。不确定性采样优先挑模型最拿不准的样本,比如猫狗概率接近五五开的图片;多样性采样让一批样本覆盖不同类型,避免预算耗在相似难例上;委员会查询则让多个模型分别判断,把分歧最大的样本交给人。三者可以组合:既盯住判断边界,也兼顾覆盖面。
这套思路尤其适合标注昂贵或稀缺的场景。以自动驾驶为例,骑车人突然从停放车辆后出现,虽少见,却可能比大量普通路况更值得先审。作者称主动学习往往能用更少标注达到与常规监督学习相近的表现,但材料没有给出具体实验数字。