CNN 两章:从 LeNet 到 ResNet

10 分钟

卷积:拿着放大镜看图片

让电脑看图,直接上 MLP 有个问题:一张 100 万像素的图摊平成一长串数字,「谁挨着谁」的空间关系全丢了。卷积神经网络(CNN)的办法是拿一个小「放大镜」(卷积核,比如 3×3)在图上滑动,专门找局部图案:第一层找边缘和色块,第二层拼出纹理和形状,再往上拼出眼睛、轮廓、整只猫。层层抽象,这就是 CNN 看世界的逻辑。

从 LeNet 到 ResNet 的进化史

  • LeNet(1998):LeCun 设计,识别美国邮政手写的邮编数字,是最早成功商用的 CNN——银行支票识别也靠它
  • AlexNet(2012):在 ImageNet 大赛(1400 万张图、1000 个类别)上把错误率从前一年的 26% 打到 15%,一举点燃全球深度学习热潮
  • VGG、GoogLeNet(2014):证明「更深」有效,但深度很快撞墙——层数一多,训练反而变差
  • ResNet(2015):何恺明等人的「残差连接」——给网络修一条「抄近道」的旁路,让信息可以跳过几层直达后方,结果一口气把网络堆到 152 层还更深,拿下当年冠军

常见误区

「网络越深必然越好」是错的:没有残差连接时,硬加深层数会出现「退化」——训练误差不降反升。ResNet 的智慧不在于深,而在于那条近道。

练一练:在书里找到 AlexNet 和 ResNet 的结构图,比一比:层数差多少?ResNet 的「近道」画在图上是什么样?

小纸条

拿一张自己的照片,用手机相册的「编辑—锐化」功能看变化,猜猜这和卷积核有什么关系。

登录 后可看答案