深度学习入门

注意力机制

10 分钟

喧闹餐厅里的超能力

鸡尾酒会上人声鼎沸,你却能只听对面朋友说话——大脑自动把「带宽」分配给重要的声音。注意力机制就是把这种能力搬进网络:面对一堆信息,算一算每份信息和当前任务的相关程度,重要的多分配权重,不重要的少分配

三个角色:Query、Key、Value

用查字典类比:你心里的问题是 Query(我想找什么),每个词条的标签是 Key(我是什么),词条的内容是 Value(我里面有什么)。拿问题去和每个标签比相似度,相似度越高,那份内容被采纳的比例越大——最后输出是所有内容的加权平均。翻译「我爱深度学习」时,生成英文的 love 这个词,模型会重点「看」中文的「爱」,这就是注意力在起作用。

一场革命

2017 年,论文「Attention Is All You Need」提出 Transformer:干脆扔掉循环结构,全靠注意力。结果训练又快、长距离也不忘,直接奠定了今天所有大模型的基础。《动手学深度学习》的「注意力机制」一章从注意力评分一直讲到 Transformer。

常见误区

注意力不是真的「理解」或「专注」,本质只是加权平均;也别把它神秘化——它的每个权重都是从数据里学出来的普通数字。

练一练:用「问题—标签—内容」三角色,描述你在图书馆找一本书的过程。

小纸条

用 Query、Key、Value 三个角色描述一次在图书馆(或书店)找书的过程。

登录 后可看答案