跳到正文

第9章笔记:序列到序列、注意力与Transformer

课程笔记

推导编码器—解码器、注意力、Transformer、位置、掩码、解码和评价。

关联:章节 第9章 序列到序列、注意力与Transformer

第9章笔记:序列到序列、注意力与Transformer

本章任务

推导编码器—解码器、注意力、Transformer、位置、掩码、解码和评价。 先用一条能人工判断的短文本、标签序列、语法树或检索集合建立基准,再让代码输出完整中间证据,最后在真实语料、困难语言切片和生产约束下验收。

七节连接

  • 编码器—解码器与条件生成:seq2seq把输入编码为状态并自回归生成输出;训练条件与推理历史不同,长度和终止需显式处理。 核心关系:P(y|x)=product_t P(y_t|y_<t,x)。 算例:三步条件概率.8,.5,.25,序列概率.1。 边界:训练时看真值历史、推理误差累积却不分析;无最大长度死循环。
  • 注意力与对齐:注意力为每个输出位置对输入表示加权求和,权重归一但不自动等于人类解释或因果对齐。 核心关系:context_t=Σ_i alpha_ti h_i,Σ_i alpha_ti=1。 算例:权重.7/.3、值2/6,上下文3.2。 边界:把注意力热图当解释证明;padding位置未mask仍分到质量。
  • Transformer自注意力:自注意力用QK相似度混合V,多头学习不同子空间;token数平方成本和mask决定可见信息。 核心关系:Attention=softmax(QK^T/sqrt(d_k))V。 算例:token从100增200,注意力矩阵元素从1万增4万,约4倍。 边界:因果任务偷看未来token;高分辨长文直接全局注意力OOM。
  • 位置编码与序列顺序:纯注意力对排列等变,需要绝对/相对/旋转位置机制表达顺序;外推长度依编码性质与训练范围。 核心关系:representation depends on token content plus declared position relation。 算例:“狗咬人”和“人咬狗”词集合相同但顺序语义相反。 边界:截断/拼接后位置ID重复;看到长上下文接口就假定有效利用全长。
  • 掩码、训练目标与标签移位:自回归训练需右移标签并遮未来;padding/ignore位置不计损失,双向掩码任务可看两侧。 核心关系:loss=-Σ evaluated positions log P(target_t|allowed context)。 算例:序列6位置中2个padding,损失只除4个有效位置。 边界:label未移位导致复制当前词;padding参与平均稀释损失。
  • 贪心、束搜索与采样:解码策略改变质量、延迟和多样性;束搜索维护累计候选,长度归一和重复惩罚需声明。 核心关系:sequence score=Σ log p_t plus declared length/coverage terms。 算例:路径A两步log分-.2-.3=-.5,B=-.1-.8=-.9,原始累计选A。 边界:每步概率最高不保证全局最好;beam扩大却无长度处理偏短。
  • 生成评价、参考与人工协议:BLEU/ROUGE等比较参考重叠,语义指标和人工评价补充事实、充分性、风格与任务成功;单一参考不完整。 核心关系:quality is a vector, not one automatic metric。 算例:语义正确的同义改写可能n-gram重叠低;高重叠文本也可能否定词错而事实相反。 边界:在测试集调生成参数;只挑自动指标最优样本展示。

实验要求

运行本章两道Python语言算法实验的四组测试,并新增空文本、Unicode边界、未知词、非法标签、句法歧义、否定、长上下文、低资源语言、域外、证据冲突或提示注入中的至少一种。保存原文hash/offset、Tokenizer、数据与模型版本、随机种子、中间格表/结构/概率、输出、证据和首个偏差。

错题闭环

按字符/token/offset、规范化、概率分母、动态规划状态、标签约束、句法结构、语义作用域、训练测试泄漏、检索召回、引用蕴含、校准、隐私和工具授权分类。更换一个词频、上下文、标签、阈值、候选数、语言或证据版本重做阶段卷;能先预测变化方向,再复算并解释失效,才算掌握。