Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.061 — 2026-09-03
PAPER 约 1 分钟

调查加权:交叉拟合真的更好吗

五折交叉拟合能否改善调查无应答校正?一项大规模模拟正在检验这个常见判断。

做调查时,麻烦不只是“答卷少”,而是“缺了谁”:如果不愿回答的人与作答者系统性不同,直接统计就可能偏。常见补救是估计每类人的响应倾向——完成调查的概率——再让低概率但实际作答的人获得更高权重,代表相似的未答者。问题在于,用机器学习估计这个概率时,是否应该把训练和预测的数据隔开?

Alessandro La Rocca 的研究专门检验五折交叉拟合:把样本分成五组,每次用其中四组训练,再预测留出的一组,以减少同一批数据既训练又预测带来的过拟合。作者在固定总体、已知真值的蒙特卡洛模拟中设置了 90 种情形,每种重复 2,000 次,并改变样本量、响应率和响应机制;模型包括传统的 Logistic Regression,以及更灵活的 Random Forest 和 Gradient Boosting Machine。

这项工作的价值,在于没有预设“交叉拟合一定更好”,而是把它放进不同调查条件下比较。不过,现有供稿只披露了研究设计,未提供偏差、波动或最终优劣结果,因此目前还不能回答标题中的问题。


供稿材料 SOURCES — 1

← 返回 2026-09-03 · 数据板块