第12章笔记:翻译、摘要、对话与多语言生成
课程笔记覆盖机器翻译、摘要事实性、对话状态、可控生成和低资源迁移。
关联:章节 第12章 翻译、摘要、对话与多语言生成
第12章笔记:翻译、摘要、对话与多语言生成
本章任务
覆盖机器翻译、摘要事实性、对话状态、可控生成和低资源迁移。 先用一条能人工判断的短文本、标签序列、语法树或检索集合建立基准,再让代码输出完整中间证据,最后在真实语料、困难语言切片和生产约束下验收。
七节连接
- 机器翻译与对齐:翻译需在源目标语言间保持意义、实体、数量、语气和格式;词/短语对齐是解释和诊断工具。 核心关系:P(target|source)=product_t P(target_t|target_<t,source)。 算例:源句含数字2026,目标漏译该数字,即使其余流畅也属关键信息丢失。 边界:只按表面逐词翻;专名和数字被自由改写。
- BLEU、长度惩罚与翻译评价:BLEU用截断n-gram精确率和长度惩罚衡量参考重叠,不能充分评价语义、术语和事实。 核心关系:BLEU=BP×exp(average log modified precisions)。 算例:候选过短即使词都正确也受BP惩罚;同义翻译可能重叠低。 边界:用句级BLEU稳定排序单句;在测试集挑参考。
- 摘要、压缩与内容选择:摘要需在长度预算内选择关键信息并保持实体/因果;抽取式和生成式有不同覆盖与新颖性。 核心关系:compression ratio=summary length/source length。 算例:原文1000词、摘要200词,压缩率20%。 边界:只优化ROUGE复制重复句;摘要省略否定词改变结论。
- 摘要事实性与引用:生成摘要可能出现实体交换、数字错误、无来源推断;逐主张对齐证据比整体相似度更严格。 核心关系:factual coverage=supported claims/all summary claims。 算例:摘要10个主张仅8个被原文支持,事实支持率80%。 边界:用另一个模型无证据打分;引用段只主题相关不蕴含主张。
- 对话状态、轮次与工具调用:任务对话需跟踪意图、槽位、确认和外部工具结果;状态是可审计对象,不应只藏在语言历史。 核心关系:next state=update(previous state,user act,tool result)。 算例:用户把日期从周一改周二,状态应覆盖日期但保留目的地,工具调用使用新版本。 边界:旧槽位残留导致订错日期;模型自行编造工具成功。
- 可控生成、采样与多样性:温度、top-k/top-p和约束解码改变随机性与可控性;多样性不能以事实、安全和schema为代价。 核心关系:temperature rescales logits before softmax。 算例:温度降低使分布更尖锐但不保证事实更正确。 边界:只展示随机最好样本;禁词过滤被变体绕过。
- 多语言、低资源与跨语言迁移:共享子词和表示可迁移,但语系、文字、领域和数据比例会造成高资源语言主导与负迁移。 核心关系:worst-language metric=min metric_l over declared languages。 算例:三语F1为.9,.75,.4,总体平均掩盖低资源语.4。 边界:把机器翻译训练数据当原生数据;只报宏平均不报最差语言。
实验要求
运行本章两道Python语言算法实验的四组测试,并新增空文本、Unicode边界、未知词、非法标签、句法歧义、否定、长上下文、低资源语言、域外、证据冲突或提示注入中的至少一种。保存原文hash/offset、Tokenizer、数据与模型版本、随机种子、中间格表/结构/概率、输出、证据和首个偏差。
错题闭环
按字符/token/offset、规范化、概率分母、动态规划状态、标签约束、句法结构、语义作用域、训练测试泄漏、检索召回、引用蕴含、校准、隐私和工具授权分类。更换一个词频、上下文、标签、阈值、候选数、语言或证据版本重做阶段卷;能先预测变化方向,再复算并解释失效,才算掌握。