注意力与 Transformer
约 10 分钟
注意力:考试划重点的艺术
翻译「小猫在垫子上睡着了」时,输出到「垫子」这个词,最该盯着原文哪个词?显然是「垫子」,而不是「睡」。注意力机制就是让模型学会「此刻该重点看哪里」:给每个输入位置算一个权重,权重越大看得越仔细,所有权重加起来等于 1——像一束可以分配亮度的探照灯。
Query、Key、Value:图书馆类比
书里的标准讲法用三个角色:
- Query(查询):你手里的检索词——「我想找猫的照片」
- Key(键):每本书的书签标签
- Value(值):书本身的内容
拿检索词和所有标签比相似度,相似度越高,那本书的内容(Value)就拿越多。所谓「自注意力」,就是句子里每个词都轮流当一次 Query,和其他所有词比一比——于是每个词都「看见」了整句话。
Transformer:2017 年的那篇论文
谷歌的论文《Attention Is All You Need》提出 Transformer:干脆抛弃 RNN,全靠自注意力 + 「多头」(同时开好几盏探照灯,各看各的角度)。没有循环,就能大规模并行训练,效果还更好。BERT、GPT、今天你听说的大语言模型,全是它的后代。书里这一章是全书的「珠峰」,值得读两遍。
常见误区
把「注意力」等同于人类注意力。它是数学上的加权平均,名字是比喻,别脑补出「意识」。
练一练:读「他把苹果放在桌上,因为它很甜」,说说「它」指什么——再想想注意力机制怎么用上下文权重解决同样的问题。
小纸条
在一句话里圈出代词(它、他、这),说出每个代词真正指谁,体会机器要靠「注意力权重」才能做的事。
登录 后可看答案