深度学习入门

多层网络:为什么要深

10 分钟

一层不够:那条画不出来的直线

单层感知机只会「画一条直线分两边」。可 1969 年,明斯基指出一个致命问题:「异或」这种简单判断(两个条件恰好一个成立才行),任何一条直线都分不开。这个批评让神经网络研究沉寂了十几年。出路是什么?——把感知机叠起来:第一层先画出几条线,第二层把线的结果组合成弯曲的边界,异或就解决了。

深度 = 特征的层层加工

为什么叠多层会厉害?看「人脸识别」这个例子:第一层从像素里找边缘(横线、竖线),第二层把边缘拼成眼睛、鼻子,第三层把五官拼成脸。每一层都在上一层的成果上继续抽象——这就是「深度」的含义:从原始数据里一层层提炼出越来越高级的特征,不需要人告诉它什么叫眼睛。

数字感受一下

今天的深度网络动辄几十上百层:图像网络 ResNet 有 152 层,大语言模型的层数也在几十到上百。这在《动手学深度学习》里对应「多层感知机」一章——李沐会从「加一层隐藏层」开始带你写。

常见误区

不是层数越多越好:层数一多,训练时信号传不动(梯度消失),效果反而变差。「深」要和后面学的技巧配套才有效。

练一练:用「像素→边缘→部件→整体」的思路,说说识别一只猫大概要哪几层加工。

小纸条

模仿人脸识别的层次,写出「识别一只猫」的三到四层特征加工过程。

登录 后可看答案