线性网络与MLP:入门两章攻略
约 10 分钟
线性回归:一切从一条直线开始
书里的第一个模型简单到可爱:猜房价。假设「房价 ≈ 面积 × w + b」,其中 w(权重)和 b(偏置)是电脑要自己学的两个数。写成公式就是 。学习的过程:先瞎猜一对 w、b,看猜得多离谱(损失函数),再往「更不离谱」的方向挪一点,重复几千次——这个「挪」的方法叫梯度下降。
梯度下降的白话版
蒙着眼睛下山:用脚探一探周围哪边最陡,就往那边迈一小步,再探、再迈。步长叫「学习率」:步太大容易冲过山谷,步太小天黑也下不了山。
MLP:给直线加上「弯」
现实不都是直线。多层感知机(MLP)在输入和输出之间加「隐藏层」,每层再接一个叫 ReLU 的开关(负数归零、正数放行)——就这一个简单的「掰弯」,网络就能拟合任意复杂的形状。书里用 Fashion-MNIST 数据集练手:6 万张 28×28 的小图,分 10 类衣物(T 恤、裤子、鞋……),一个两层 MLP 就能认对八成以上。
常见误区
层数越多越好?不一定。层数多了会「过拟合」——把训练题的答案背下来,换个新题就懵。书里专门讲了过拟合和应对办法(权重衰减、暂退法),值得精读。
练一练:找 10 个「房屋面积—价格」的真实挂牌数据,在纸上画点、徒手画一条直线,体会「拟合」在干什么。
小纸条
用家长的手机查 5 套同小区房子的面积和总价,看看面积每多 10 平米,价格大约多多少。
登录 后可看答案