注意力机制
约 10 分钟
喧闹餐厅里的超能力
鸡尾酒会上人声鼎沸,你却能只听对面朋友说话——大脑自动把「带宽」分配给重要的声音。注意力机制就是把这种能力搬进网络:面对一堆信息,算一算每份信息和当前任务的相关程度,重要的多分配权重,不重要的少分配。
三个角色:Query、Key、Value
用查字典类比:你心里的问题是 Query(我想找什么),每个词条的标签是 Key(我是什么),词条的内容是 Value(我里面有什么)。拿问题去和每个标签比相似度,相似度越高,那份内容被采纳的比例越大——最后输出是所有内容的加权平均。翻译「我爱深度学习」时,生成英文的 love 这个词,模型会重点「看」中文的「爱」,这就是注意力在起作用。
一场革命
2017 年,论文「Attention Is All You Need」提出 Transformer:干脆扔掉循环结构,全靠注意力。结果训练又快、长距离也不忘,直接奠定了今天所有大模型的基础。《动手学深度学习》的「注意力机制」一章从注意力评分一直讲到 Transformer。
常见误区
注意力不是真的「理解」或「专注」,本质只是加权平均;也别把它神秘化——它的每个权重都是从数据里学出来的普通数字。
练一练:用「问题—标签—内容」三角色,描述你在图书馆找一本书的过程。
小纸条
用 Query、Key、Value 三个角色描述一次在图书馆(或书店)找书的过程。
登录 后可看答案