看到结果怎样反推原因:贝叶斯与逆概率
约 48 分钟
看到结果怎样反推原因:贝叶斯与逆概率
不确定性为什么成为数学问题
前几课从模型推结果,这一课反过来:已经看到证据,怎样更新对原因的判断?贝叶斯的一篇身后发表论文给出相关逆向推断形式,拉普拉斯随后把逆概率方法推广到更广的问题。核心不是背一个公式,而是把先验可能、证据在不同原因下出现的概率和证据后的判断连成同一条链。
这一章每一课都先区分三层:现实中发生了什么,数据怎样被记录,模型怎样给结果加权。概率不是把无知包装成小数,统计也不是把表格交给公式。只有样本空间、抽样机制和问题目标说清楚,数值才有含义。
陪你算一次
某状态在人群中占10%,检测灵敏度80%,特异度90%。一万人中约1000人有状态,其中800人阳性;9000人无状态,其中900人假阳性。阳性共1700人,阳性后的概率为800/1700≈0.470588。即使检测看起来不错,低基率仍会显著影响后验。
计算时请保留分母、权重、样本量或残差,不要只交最终小数。算完再用一句话解释这个数对单次事件、长期重复或总体参数分别意味着什么;这三种解释不能互换。
历史与模型边界
贝叶斯公式不会替你决定先验从哪里来,也不会把质量差的数据变好。先验可来自历史频率、明确模型或需要说明的主观判断;似然依赖抽样和测量机制。把P(阳性|有状态)误当P(有状态|阳性),就是典型的条件倒置。
历史判断仍按四步:原问题、可用数据、数学方法、尚未解决的限制。不要把后来的统一术语原样倒贴给早期作者,也不要因为早期材料不完备就抹去方法创新。制度怎样记录数据、谁被纳入样本,同公式本身一样值得检查。
与全章连接
赌博分配先建立可能分支,期望把结果按价值加权,人口表把个案聚成频率,贝叶斯从证据反推原因,误差理论从重复测量估计真值,相关再描述变量共同变化。每一步都扩大了可处理问题,同时引入新的假设与误用风险。
把本课的数值分别放进单次、重复试验和决策三个句子中,检查主语是否一致。若同一个数在三句话里被解释成确定结果、长期平均和个人偏好,就要立即拆开重写。
迁移任务
更换正文数值重新计算,并故意破坏一个假设:让骰子有偏、样本漏报、检测基率改变、测量含系统误差或相关来自共同原因。比较答案如何改变,写出模型失效的具体位置。能指出失败边界,才算真正会用。
本课验收
完成单选、多选和数值题。选择题漏选或多选均不得分;数值题保留计算链,并写一句不允许从该数值推出的结论。
Practice
本课练习
先独立作答再提交;编程题会在隔离沙箱中真实编译、运行并对拍。