CNN 两章:从 LeNet 到 ResNet
约 10 分钟
卷积:拿着放大镜看图片
让电脑看图,直接上 MLP 有个问题:一张 100 万像素的图摊平成一长串数字,「谁挨着谁」的空间关系全丢了。卷积神经网络(CNN)的办法是拿一个小「放大镜」(卷积核,比如 3×3)在图上滑动,专门找局部图案:第一层找边缘和色块,第二层拼出纹理和形状,再往上拼出眼睛、轮廓、整只猫。层层抽象,这就是 CNN 看世界的逻辑。
从 LeNet 到 ResNet 的进化史
- LeNet(1998):LeCun 设计,识别美国邮政手写的邮编数字,是最早成功商用的 CNN——银行支票识别也靠它
- AlexNet(2012):在 ImageNet 大赛(1400 万张图、1000 个类别)上把错误率从前一年的 26% 打到 15%,一举点燃全球深度学习热潮
- VGG、GoogLeNet(2014):证明「更深」有效,但深度很快撞墙——层数一多,训练反而变差
- ResNet(2015):何恺明等人的「残差连接」——给网络修一条「抄近道」的旁路,让信息可以跳过几层直达后方,结果一口气把网络堆到 152 层还更深,拿下当年冠军
常见误区
「网络越深必然越好」是错的:没有残差连接时,硬加深层数会出现「退化」——训练误差不降反升。ResNet 的智慧不在于深,而在于那条近道。
练一练:在书里找到 AlexNet 和 ResNet 的结构图,比一比:层数差多少?ResNet 的「近道」画在图上是什么样?
小纸条
拿一张自己的照片,用手机相册的「编辑—锐化」功能看变化,猜猜这和卷积核有什么关系。
登录 后可看答案