统计推断初步:样本会不会骗人
约 12 分钟
调查全校睡眠时间通常无法询问每一个人,于是从总体中抽取样本。样本统计可以帮助了解总体,但结论是否可信,不只看人数多少,还看抽样方式、问题设计和数据质量。
便利样本的偏差
只在早到校的同学中调查睡眠,可能系统性漏掉晚到者;在网上自愿填写的人也可能对主题更关心。样本再大,若选择机制偏向某类人,仍不能代表总体。
随机抽样
给总体成员编号后随机选取,让每个人有已知机会进入样本。分层抽样可先按年级分组,再按比例随机选,避免小年级被淹没。随机不保证完美,却能减少人为挑选。
平均数、中位数与异常值
少数极晚睡数据会明显拉高平均数,中位数相对稳定。报告应展示分布、样本数、最小最大和异常值处理,而不是只给一个中心数字。异常值可能是录入错,也可能是真实重要个案,不能随意删除。
问法改变回答
“你是否也认为睡够很重要?”带有暗示;“过去七天通常几点入睡?”更具体,但自我报告仍可能不准。定义“入睡”还是“上床”,结果会不同。
结论边界
样本显示相关关系,不能直接宣称因果。应写“在本次样本和方法下观察到”,并列限制和需要的后续数据。
练习:为估计全年级通勤时间设计抽样方案与问卷,指出至少三种偏差及降低办法。
小纸条
为什么一个很大的便利样本仍可能不代表总体?