跳到正文

第5章笔记:序列标注与结构化预测

课程笔记

贯通HMM、Viterbi、CRF、词性、命名实体、BIO和弱监督评价。

关联:章节 第5章 序列标注与结构化预测

第5章笔记:序列标注与结构化预测

本章任务

贯通HMM、Viterbi、CRF、词性、命名实体、BIO和弱监督评价。 先用一条能人工判断的短文本、标签序列、语法树或检索集合建立基准,再让代码输出完整中间证据,最后在真实语料、困难语言切片和生产约束下验收。

七节连接

  • 序列标注与局部—全局约束:POS、NER等为token/span赋标签;逐token分类忽略标签转移,全局模型用序列得分约束合法结构。 核心关系:best tags=argmax_y score(x,y) over legal sequences。 算例:BIO中I-PER不能在O后无B-PER直接出现,局部最高分序列可能非法。 边界:子词标签未映回词/span;padding位置计入损失。
  • HMM生成假设与参数:HMM用标签转移和词发射生成观测,假设当前标签只依赖前一标签、当前词只依赖当前标签。 核心关系:P(x,y)=P(y1) product transitions product emissions。 算例:初始.5、发射.4、转移.2、第二发射.5,两步联合概率.02。 边界:把未知词发射设零;训练与解码标签集合不一致。
  • Viterbi动态规划:Viterbi保存到每位置/状态的最佳路径分数和回指,避免枚举指数序列。 核心关系:V[t,s]=emission(t,s)+max_prev(V[t-1,prev]+transition)。 算例:某状态两条候选对数分数-3和-2,保留-2及其前驱。 边界:只保留每位置全局一个状态;回指未随最大值更新。
  • 线性链CRF与归一化:CRF直接给条件序列分布,联合发射/转移特征并用全局配分函数归一;训练需前向—后向。 核心关系:P(y|x)=exp(score(x,y))/Z(x)。 算例:两条序列未归一权重2和3,第一条概率.4。 边界:只算gold得分不算Z;训练用非法BIO序列进入状态空间。
  • 词性标注与标签体系:词性依语言和标注目的,粗细粒度、兼类与未知词处理影响可比性和下游用途。 核心关系:accuracy=correct tokens/evaluated tokens under same guideline。 算例:“研究”在“研究问题”是动词,在“研究成果”可作名词修饰,需上下文和指南。 边界:把不同树库标签直接合并;标点/多词表达口径未声明。
  • 命名实体、BIO与跨度解码:NER同时识别实体边界和类型;BIO/BILOU编码需合法化并映回原文字符偏移。 核心关系:entity exact F1 from span+type TP,FP,FN。 算例:金标[0,4)ORG,预测[0,3)ORG,严格跨度不算TP。 边界:只报token准确率;把重叠实体强塞单层BIO不说明丢失。
  • 弱监督、字典与序列评价:字典、规则和远程监督可扩标注,但覆盖偏差和噪声需建模;评价必须在独立人工金标集。 核心关系:estimated correct weak labels=accepted×precision_on_audit_sample。 算例:接受1000弱标签,抽检精度.85,预计约850正确。 边界:用同一字典生成训练和测试金标;未匹配样本都标O。

实验要求

运行本章两道Python语言算法实验的四组测试,并新增空文本、Unicode边界、未知词、非法标签、句法歧义、否定、长上下文、低资源语言、域外、证据冲突或提示注入中的至少一种。保存原文hash/offset、Tokenizer、数据与模型版本、随机种子、中间格表/结构/概率、输出、证据和首个偏差。

错题闭环

按字符/token/offset、规范化、概率分母、动态规划状态、标签约束、句法结构、语义作用域、训练测试泄漏、检索召回、引用蕴含、校准、隐私和工具授权分类。更换一个词频、上下文、标签、阈值、候选数、语言或证据版本重做阶段卷;能先预测变化方向,再复算并解释失效,才算掌握。