跳到正文
概率与统计

效应量与功效:显著不等于重要

14 分钟

样本足够大时,极小差异也可能得到很小p值;样本太小时,重要差异又可能未显著。效应量描述差异有多大,统计功效描述设计发现指定效应的概率,两者把注意力从“有没有星号”转向实际问题。

原始与标准化效应

均值差保留原单位,便于业务解释;标准化差异除以波动,便于跨量表比较,却可能因组内方差变化而改变。优先报告原始单位并给必要标准化补充。

最小有意义效应

在收集数据前,由成本、风险或专业标准定义多大差异值得行动。它不是事后根据结果挑选的阈值,也不等于统计可检测下限。

功效分析

给定显著性水平、样本量、噪声和目标效应,可估检验功效。目标效应应来自实际意义或可靠先验研究,不能用小型预实验的夸大估计机械计算。

精度导向设计

若重点是估计,可按希望置信区间多窄来规划样本,而非只追求80%功效。复杂抽样、流失和多重比较需纳入膨胀。

观察功效误区

用已经观察到的效应计算“事后功效”通常只是p值的变形,不增加信息。直接报告估计与区间更透明。

还要考虑实施中的聚类和流失;同班、同医院个体并非完全独立,实际有效样本量可能远小于人数。

练习:为一个教育干预定义最小有意义效应,用不同噪声和样本量比较功效与区间宽度。

小纸条

统计结果显著为什么不保证它具有实际重要性?