线性网络与MLP:入门两章攻略

10 分钟

线性回归:一切从一条直线开始

书里的第一个模型简单到可爱:猜房价。假设「房价 ≈ 面积 × w + b」,其中 w(权重)和 b(偏置)是电脑要自己学的两个数。写成公式就是 。学习的过程:先瞎猜一对 w、b,看猜得多离谱(损失函数),再往「更不离谱」的方向挪一点,重复几千次——这个「挪」的方法叫梯度下降

梯度下降的白话版

蒙着眼睛下山:用脚探一探周围哪边最陡,就往那边迈一小步,再探、再迈。步长叫「学习率」:步太大容易冲过山谷,步太小天黑也下不了山。

MLP:给直线加上「弯」

现实不都是直线。多层感知机(MLP)在输入和输出之间加「隐藏层」,每层再接一个叫 ReLU 的开关(负数归零、正数放行)——就这一个简单的「掰弯」,网络就能拟合任意复杂的形状。书里用 Fashion-MNIST 数据集练手:6 万张 28×28 的小图,分 10 类衣物(T 恤、裤子、鞋……),一个两层 MLP 就能认对八成以上。

常见误区

层数越多越好?不一定。层数多了会「过拟合」——把训练题的答案背下来,换个新题就懵。书里专门讲了过拟合和应对办法(权重衰减、暂退法),值得精读。

练一练:找 10 个「房屋面积—价格」的真实挂牌数据,在纸上画点、徒手画一条直线,体会「拟合」在干什么。

小纸条

用家长的手机查 5 套同小区房子的面积和总价,看看面积每多 10 平米,价格大约多多少。

登录 后可看答案