卷积网络CNN:看图的高手
约 10 分钟
图片为什么不能直接喂给普通网络
一张 1000×1000 的照片有 300 万个数字,若每个都连到下一层的 100 个神经元,光第一层就要 3 亿个权重——算不动,也学不好。卷积网络(CNN)用了一个聪明的假设:识别一个图案,只需要看局部。猫的眼睛在哪里不重要,重要的是「这一小片区域像不像眼睛」。
卷积核:一块滑动的印章
卷积核是一个小方块(比如 3×3,只有 9 个参数),它像印章一样在整张图上从左到右、从上往下滑,每到一处就算一次匹配度。关键在参数共享:同一个印章盖遍全图,所以 9 个参数就能检查 300 万个位置——参数量暴降,还顺带获得「图案换个位置也能认出」的能力。一层层叠上去:第一层认边缘,中间认纹理和部件,高层认整张脸。
两个里程碑
1998 年 LeCun 的 LeNet 已经能识别邮局手写的邮政编码;2012 年 AlexNet 在 ImageNet 大赛上把错误率从 26% 一举压到 15%,引爆了整个深度学习浪潮。《动手学深度学习》用「卷积神经网络」加「现代卷积神经网络」两章讲完这段历史。
常见误区
卷积不是把图「卷起来」,而是模板滑窗匹配;另外 CNN 也不是万能的——它擅长局部图案,理解全局关系要靠更后面学的注意力。
练一练:找出手机里两处用到 CNN 的地方(如人脸解锁、相册人物分类),说说它们各自在「看」什么。
小纸条
找出生活中两个用到 CNN 视觉能力的场景,说明各自在识别什么。
登录 后可看答案