跳到正文

测量总有偏差:正态误差与最小二乘

48 分钟

测量总有偏差:正态误差与最小二乘

不确定性为什么成为数学问题

天文和测地观测常对同一量得到不同数值,单次测量不再能被当作真值。十八至十九世纪,误差分布、正态曲线与参数估计逐渐联系起来;勒让德公开提出最小二乘法,高斯也发展并论证其观测应用。新的目标是从带误差数据中选择一个可复核的估计,并说明它依赖哪些误差假设。

这一章每一课都先区分三层:现实中发生了什么,数据怎样被记录,模型怎样给结果加权。概率不是把无知包装成小数,统计也不是把表格交给公式。只有样本空间、抽样机制和问题目标说清楚,数值才有含义。

陪你算一次

三次等精度测量为9、10、11。若估计值为a,平方残差和是(9-a)²+(10-a)²+(11-a)²;展开或求导可知在a=10时最小。这个结果等于样本均值。平方让正负误差不互相抵消并重罚大偏差,但也使离群值影响变大。

计算时请保留分母、权重、样本量或残差,不要只交最终小数。算完再用一句话解释这个数对单次事件、长期重复或总体参数分别意味着什么;这三种解释不能互换。

历史与模型边界

钟形误差并非所有数据的自然定律。系统偏差不会因重复测量自动消失,重尾或相关误差会破坏简单模型,测量精度不同还需加权。最小二乘是目标函数,不等于因果真理;正态假设可以说明某些最优性质,却必须接受残差诊断和实验设计检查。

历史判断仍按四步:原问题、可用数据、数学方法、尚未解决的限制。不要把后来的统一术语原样倒贴给早期作者,也不要因为早期材料不完备就抹去方法创新。制度怎样记录数据、谁被纳入样本,同公式本身一样值得检查。

与全章连接

赌博分配先建立可能分支,期望把结果按价值加权,人口表把个案聚成频率,贝叶斯从证据反推原因,误差理论从重复测量估计真值,相关再描述变量共同变化。每一步都扩大了可处理问题,同时引入新的假设与误用风险。

把本课的数值分别放进单次、重复试验和决策三个句子中,检查主语是否一致。若同一个数在三句话里被解释成确定结果、长期平均和个人偏好,就要立即拆开重写。

迁移任务

更换正文数值重新计算,并故意破坏一个假设:让骰子有偏、样本漏报、检测基率改变、测量含系统误差或相关来自共同原因。比较答案如何改变,写出模型失效的具体位置。能指出失败边界,才算真正会用。

本课验收

完成单选、多选和数值题。选择题漏选或多选均不得分;数值题保留计算链,并写一句不允许从该数值推出的结论。

Practice

本课练习

3

先独立作答再提交;编程题会在隔离沙箱中真实编译、运行并对拍。

1单选:测量总有偏差:正态误差与最小二乘 3

最小二乘估计在本课模型中做了什么?

登录 后答题可以领积分
2多选:测量总有偏差:正态误差与最小二乘 3

选择所有符合本课历史事实与模型边界的说法。漏选或多选均不得分。

多选题:必须选全正确项,漏选或多选均不得分。

登录 后答题可以领积分
3定量推演:测量总有偏差:正态误差与最小二乘 3

完成正文中的定量推演并填写最终数值;草稿必须保留概率权重、样本量或残差,并说明一个不能由结果推出的结论。

登录 后答题可以领积分