RNN 与现代循环网络
约 10 分钟
序列数据:顺序本身就是信息
「狗咬人」和「人咬狗」,字一样、意思天差地别——顺序重要。句子、股价、心电图、天气,都是「序列」。前面学的网络没有记忆,每个输入都是全新的一天;循环神经网络(RNN) 给网络加了记忆:每读一个词,都把「目前读到的意思」压缩成一个状态向量 传给自己下一步用。白话:边读边记小抄。
RNN 的阿喀琉斯之踵
记忆会「褪色」。一段话很长时,开头的信息传到结尾已经模糊不清——数学上叫「梯度消失」,连乘几十个小数,结果趋近于零。所以原始 RNN 只能记住最近几个词,「前情提要」全忘了。
LSTM 和 GRU:给记忆装上闸门
书里「现代循环网络」一章的主角:
- LSTM 设计了三道「闸门」:遗忘门(旧的哪些扔掉)、输入门(新的哪些记下)、输出门(现在掏出多少)。像一位会整理笔记的学生——不是所有内容都抄,重要才记
- GRU 是 LSTM 的精简版,少一道门、更快,效果常常差不多
有了闸门,网络能记住几百步之前的信息,机器翻译、语音识别在 2014–2016 年间因此突飞猛进。
常见误区
「RNN 已被 Transformer 淘汰,不用学」——过半对。今天的大模型确实以 Transformer 为主,但「处理顺序」和「记忆管理」的思想是一脉相承的,不懂 RNN 就很难理解注意力要解决什么问题。
练一练:玩「接龙遗忘」游戏:家长读一句 30 字的长句,你立刻复述开头 5 个字——体会「梯度消失」有多真实。
小纸条
找一句绕口令或长句(比如报菜名),试试只听一遍能记住开头还是结尾。
登录 后可看答案