抽样设计:数据从哪里来决定能说什么
约 14 分钟
统计推断不是从表格第一行开始,而是从数据怎样产生开始。总体是想了解的对象集合,样本是实际观察部分,抽样框则是有机会被选中的名单。三者不一致时,再复杂的模型也无法自动修复代表性。
随机抽样与便利抽样
简单随机抽样让总体成员有已知机会入样;便利抽样只调查容易接触的人,常系统性漏掉某些群体。样本很大只能减小随机误差,不能消除选择偏差。
分层与整群
不同年级差异明显时,可先按年级分层后分别随机抽样,提高覆盖与精度;整群抽取完整班级执行方便,但同班成员相似,会降低有效信息量。设计决定后续标准误怎样计算。
无应答偏差
被抽中却不回答的人可能与回答者不同。高回复率有帮助,却仍需比较已知特征、记录联系过程,并避免通过强迫回应制造伦理问题。
测量误差
问题措辞、回忆期限、仪器和访谈环境都会改变数据。随机抽中并不保证测量准确。先做小规模预测试,检查同一问题是否被一致理解。
权重与外推
不同比例抽样可用权重恢复总体结构,但权重过大增加方差。结论只能外推到抽样框和设计支持的人群。
练习:为估计全校睡眠时长设计抽样方案,写总体、抽样框、分层、无应答处理和不能外推的人群。
小纸条
为什么扩大便利样本不能自动消除选择偏差?