多层感知机:叠起来的威力
约 10 分钟
一条直线不够,那就两条
回忆第三讲的难题:「异或」用一条直线分不开。解决办法出人意料地朴素——用两个神经元各画一条直线,再用第三个神经元把它们的输出组合起来,就拼出了折角,异或迎刃而解。一层不行就两层:输入层 → 隐藏层 → 输出层,这就是多层感知机(MLP),最经典的神经网络。
隐藏层在偷偷做什么
第一章讲过特征工程:人替机器设计好输入。多层感知机的隐藏层,相当于自动学特征——第一层学着识别简单的模式(边缘、明暗),越深的层组合出越复杂的概念(眼睛 → 脸 → 表情)。人只给原始像素,中间的特征是网络自己长出来的,这是深度学习最深刻的转变。
一个数量级的直觉
一个两层小网络:784 个输入(28×28 的手写数字图片)、128 个隐藏神经元、10 个输出,参数约 10 万个。GPT 级别的模型有上千亿参数——结构思想没变,只是规模差了百万倍。
常见误区
层数不是越多越好。第一章讲过过拟合:层数猛加而数据没变多,模型就开始背答案;而且层太深训练会变难。加层之前,先问数据够不够。
练一练:画一个「2 输入 → 3 隐藏 → 1 输出」的小网络草图,数一数有几条连线(权重)。
小纸条
画一个三层小网络并数清它的权重条数,说说隐藏层在学什么。
登录 后可看答案