看到一项研究说“效应存在”,先别急着接受结论。就像新方案把转化率从 10% 提到 10.2%,差异或许能通过统计检验,却未必值得投入成本。统计显著性——数据在“没有效应”的假设下是否足够反常——还很受样本量影响;样本够大,微小差异也可能显著。
Andrew 举了一个更直观的例子:某研究报告,干预让五分量表的平均得分改变 0.8。理论上的最大变化虽是 4 分,但许多人原本已在 4 或 5 分,平均改变 2 分都堪称巨大。因此,0.8 相当于现实中近乎最大可想象变化的 40%,大得反常,也就值得进一步审查。
这正是效应大小的价值:它不只问“有没有”,还问“有多大、是否合理、够不够改变决策”。把估计值及置信区间——与数据相容的效应范围——同预先设定的最小重要差异比较,通常比只盯着 p 值更接近真正的问题。