信息熵与最大熵原理
约 28 分钟
信息熵与最大熵原理
离散分布的 Shannon 熵是 ,衡量在给定描述层次下的平均不确定性。两个等概率结果各为 ,故 ;若其中一个结果概率为 1,熵降为 0。底数决定单位,换成自然对数后单位是 nat,不能混合数值比较。
最大熵原理是在明确约束下选择不额外塞入结构的分布。只给归一化约束得到均匀分布;再给平均能量得到指数族 。Lagrange 乘子由约束反演,不是可以任意调节的“温度标签”。
建模时先把矩约束写成数据统计量,求解乘子后必须在未参与约束的留出统计量上检验,例如三阶矩、尾部概率或变量间相关。将经验分布的 bootstrap 区间传到参数,可区分真实模型偏差与有限样本波动。
最大熵只相对于已声明的状态空间、参考测度和约束最少承诺;改变坐标却继续用“均匀”会隐含不同先验。遗漏守恒量或相关约束时,结果会系统错误。高熵也不等于物理上更混乱或价值更低,它是对概率分布与编码问题的定量概念。
Practice
本课练习
先独立作答再提交;编程题会在隔离沙箱中真实编译、运行并对拍。