ResNet:残差连接让网络深到 152 层
约 10 分钟
越深越差?这说不通
理论上网络越深越能学复杂规律,可实验发现:56 层的网络在训练集上的表现居然比 20 层的还差——不是过拟合,是连训练都训不好。2015 年,何恺明团队的 ResNet 用一个简单到惊人的改动解决了这个问题,直接拿下 ImageNet 冠军,错误率低到 3.57%,首次超过人类的约 5%。
抄近道的智慧
ResNet 的核心叫残差连接:每几层之间加一条「抄近道」的旁路,输出不是加工结果 ,而是 ,白话就是——这一层只学「在原有基础上该改多少」,改不动就原样传下去。像改作文:不再重写整篇,只在原文上批注修改,最差也是保持原文,不会越改越烂。这样一来,梯度可以顺着旁路直接传回浅层,梯度消失大大缓解,152 层也练得动。
影响深远的一笔
ResNet 之后,「加一条旁路」成了深度学习的标准件:今天的大模型内部每一层都有残差连接,视觉、语音、语言模型无一例外。《动手学深度学习》在「现代卷积神经网络」一章从原理到代码讲透了 ResNet,还顺便讲了它之前的 VGG、GoogLeNet 等前辈。
常见误区
残差连接不是「跳过某些层不用」,而是「加工结果 + 原文」一起往下传;层数深也不是为了炫技,是为了支撑更精细的特征提炼。
练一练:用「改作文」的类比给家长讲一遍残差连接,重点说清为什么它不会「越改越烂」。
小纸条
用改作文的类比向家长解释残差连接,说明它为什么让深网络训得动。
登录 后可看答案