概率与统计

熵:给不确定性定量

10 分钟

不确定性也能称斤两。掷硬币和掷骰子,哪个更「没谱」?直觉是骰子——6 种结果比 2 种更难猜。信息论创始人香农把这个直觉变成了公式:,用来度量一个随机变量带着多少不确定性。

熵的白话平均要用多少个是非题,才能问出结果。均匀硬币的熵是 1 比特(问 1 次:是正面吗?);均匀骰子约 2.58 比特。公式是 ——每种结果的概率乘上自己的「惊讶度」再求和。白话:结果越多、越均匀,熵越大;结果越确定,熵越小;必然发生的事件,熵为 0。

惊讶度为什么用对数:小概率事件发生时信息量大(「太阳从西边出来」是大新闻),大概率事件没什么信息量。概率每减半,信息量增加 1 比特——对数恰好刻画这种「翻倍减半」的关系。

熵就在你身边:ZIP 压缩利用「字母出现不均匀」——e 出现多就配短编码,z 少用长编码,平均长度逼近熵,这就是压缩的理论极限。第一章结尾提到的交叉熵损失,本质是让模型的分布贴近真实分布——训练神经网络,就是在给不确定性降熵

常见误区:熵大不是「混乱无用」。熵是客观描述:天气预报的熵大,说明气候本身多变,提醒人们别瞎猜、多留预案。它度量的是世界,不是度量谁的水平。

练一练:一枚硬币正面概率 90%,和均匀硬币比,哪个熵大?猜它的结果时,你的最优策略是什么?

小纸条

和家长玩「二十个问题」:心里想一个动物,对方只用是非题猜,记录平均几个问题猜中——这就是在测量熵。

登录 后可看答案