跳到正文
概率与统计

抽样设计:数据从哪里来决定能说什么

14 分钟

统计推断不是从表格第一行开始,而是从数据怎样产生开始。总体是想了解的对象集合,样本是实际观察部分,抽样框则是有机会被选中的名单。三者不一致时,再复杂的模型也无法自动修复代表性。

随机抽样与便利抽样

简单随机抽样让总体成员有已知机会入样;便利抽样只调查容易接触的人,常系统性漏掉某些群体。样本很大只能减小随机误差,不能消除选择偏差。

分层与整群

不同年级差异明显时,可先按年级分层后分别随机抽样,提高覆盖与精度;整群抽取完整班级执行方便,但同班成员相似,会降低有效信息量。设计决定后续标准误怎样计算。

无应答偏差

被抽中却不回答的人可能与回答者不同。高回复率有帮助,却仍需比较已知特征、记录联系过程,并避免通过强迫回应制造伦理问题。

测量误差

问题措辞、回忆期限、仪器和访谈环境都会改变数据。随机抽中并不保证测量准确。先做小规模预测试,检查同一问题是否被一致理解。

权重与外推

不同比例抽样可用权重恢复总体结构,但权重过大增加方差。结论只能外推到抽样框和设计支持的人群。

练习:为估计全校睡眠时长设计抽样方案,写总体、抽样框、分层、无应答处理和不能外推的人群。

小纸条

为什么扩大便利样本不能自动消除选择偏差?