闭卷重建编码器—解码器与条件生成的对象、公式、算例、算法与失败边界。
自然语言处理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建注意力与对齐的对象、公式、算例、算法与失败边界。
闭卷重建Transformer自注意力的对象、公式、算例、算法与失败边界。
闭卷重建位置编码与序列顺序的对象、公式、算例、算法与失败边界。
闭卷重建掩码、训练目标与标签移位的对象、公式、算例、算法与失败边界。
闭卷重建贪心、束搜索与采样的对象、公式、算例、算法与失败边界。
闭卷重建生成评价、参考与人工协议的对象、公式、算例、算法与失败边界。
对象:注意力为每个输出位置对输入表示加权求和,权重归一但不自动等于人类解释或因果对齐。;公式:context_t=Σ_i alpha_ti h_i,Σ_i alpha_ti=1。;算例:权重.7/.3、值2/6,上下文3.2。;边界:把注意力热图当解释证明;padding位置未mask仍分到质量。。
对象:seq2seq把输入编码为状态并自回归生成输出;训练条件与推理历史不同,长度和终止需显式处理。;公式:P(y|x)=product_t P(y_t|y_<t,x)。;算例:三步条件概率.8,.5,.25,序列概率.1。;边界:训练时看真值历史、推理误差累积却不分析;无最大长度死循环。。
对象:纯注意力对排列等变,需要绝对/相对/旋转位置机制表达顺序;外推长度依编码性质与训练范围。;公式:representation depends on token content plus declared position relation。;算例:“狗咬人”和“人咬狗”词集合相同但顺序语义相反。;边界:截断/拼接后位置ID重复;看到长上下文接口就假定有效利用全长。。
对象:自注意力用QK相似度混合V,多头学习不同子空间;token数平方成本和mask决定可见信息。;公式:Attention=softmax(QK^T/sqrt(d_k))V。;算例:token从100增200,注意力矩阵元素从1万增4万,约4倍。;边界:因果任务偷看未来token;高分辨长文直接全局注意力OOM。。
对象:解码策略改变质量、延迟和多样性;束搜索维护累计候选,长度归一和重复惩罚需声明。;公式:sequence score=Σ log p_t plus declared length/coverage terms。;算例:路径A两步log分-.2-.3=-.5,B=-.1-.8=-.9,原始累计选A。;边界:每步概率最高不保证全局最好;beam扩大却无长度处理偏短。。
对象:自回归训练需右移标签并遮未来;padding/ignore位置不计损失,双向掩码任务可看两侧。;公式:loss=-Σ evaluated positions log P(target_t|allowed context)。;算例:序列6位置中2个padding,损失只除4个有效位置。;边界:label未移位导致复制当前词;padding参与平均稀释损失。。
对象:BLEU/ROUGE等比较参考重叠,语义指标和人工评价补充事实、充分性、风格与任务成功;单一参考不完整。;公式:quality is a vector, not one automatic metric。;算例:语义正确的同义改写可能n-gram重叠低;高重叠文本也可能否定词错而事实相反。;边界:在测试集调生成参数;只挑自动指标最优样本展示。。