第7章笔记:语义、篇章与语用
课程笔记覆盖逻辑形式、词义、语义角色、指代、篇章、语用和自然语言推理。
关联:章节 第7章 语义、篇章与语用
第7章笔记:语义、篇章与语用
本章任务
覆盖逻辑形式、词义、语义角色、指代、篇章、语用和自然语言推理。 先用一条能人工判断的短文本、标签序列、语法树或检索集合建立基准,再让代码输出完整中间证据,最后在真实语料、困难语言切片和生产约束下验收。
七节连接
- 组合语义与逻辑形式:组合原则用词义和句法结构构造句义;逻辑形式显式表示实体、谓词、量词、否定和作用域。 核心关系:meaning(parent)=compose(rule,meaning(children))。 算例:“每个学生读一本书”可有每人不同书或同一本书两种量词作用域。 边界:把字符串相似当语义等价;自由变量和量词范围未标。
- 词义消歧与语境:WSD从词义清单中按上下文选择sense;词义粒度、清单覆盖和跨域用法决定上限。 核心关系:sense*=argmax_s P(s|context,lexicon)。 算例:“苹果发布手机”偏组织/品牌,“吃苹果”偏水果,邻近谓词提供证据。 边界:测试定义文本进入训练;把新义强塞最近旧义不拒识。
- 语义角色标注:SRL识别谓词及其论元角色,关注谁对谁做了什么、何时何地;跨句省略和被动需处理。 核心关系:span/dep roles conditioned on predicate and sentence。 算例:“小王被老师表扬”中老师是施事、小王是受事,表面主语不等于施事。 边界:把依存主语永远标A0;一个span被不允许地分配冲突角色。
- 指代消解与实体簇:指代把提及聚成实体簇,需性数类别、语义和篇章显著性;代词外还含名词短语与零指代。 核心关系:pair/link scores must produce a globally consistent clustering。 算例:“小李告诉小王他获奖了”中“他”可能指两人,句内线索不足。 边界:A同B、B同C却A不同C;只评代词不评全实体簇。
- 篇章关系与连贯:句间因果、转折、时序、详述等关系连接篇章;显式连接词不是唯一证据,结构可多层嵌套。 核心关系:coherence score depends on discourse relation sequence and entity continuity。 算例:“下雨了。因此比赛取消。”是显式因果;去掉“因此”关系仍可能由世界知识推断。 边界:见“但是”就固定转折而忽略范围;单句分类冒充篇章结构。
- 语用、言外之意与会话含义:语用解释依说话者目标、共同知识和合作原则;字面真值不足以恢复讽刺、间接请求和预设。 核心关系:intended meaning∝literal meaning+context+speaker goal+common ground。 算例:“这里有点冷”在开窗房间可能是请求关窗,不只是温度陈述。 边界:模型凭社会刻板印象猜意图;把礼貌表达都归同一动作。
- 自然语言推理与蕴含边界:NLI判断前提是否蕴含、矛盾或中立;标签依世界是否封闭、量词、否定和常识范围。 核心关系:entailment means every model satisfying premise also satisfies hypothesis。 算例:前提“所有猫都是动物”蕴含“这只猫若是猫则是动物”,但不蕴含“所有动物是猫”。 边界:高词汇重叠就判蕴含;把未知事实当矛盾。
实验要求
运行本章两道Python语言算法实验的四组测试,并新增空文本、Unicode边界、未知词、非法标签、句法歧义、否定、长上下文、低资源语言、域外、证据冲突或提示注入中的至少一种。保存原文hash/offset、Tokenizer、数据与模型版本、随机种子、中间格表/结构/概率、输出、证据和首个偏差。
错题闭环
按字符/token/offset、规范化、概率分母、动态规划状态、标签约束、句法结构、语义作用域、训练测试泄漏、检索召回、引用蕴含、校准、隐私和工具授权分类。更换一个词频、上下文、标签、阈值、候选数、语言或证据版本重做阶段卷;能先预测变化方向,再复算并解释失效,才算掌握。