闭卷重建序列标注与局部—全局约束的对象、公式、算例、算法与失败边界。
自然语言处理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建HMM生成假设与参数的对象、公式、算例、算法与失败边界。
闭卷重建Viterbi动态规划的对象、公式、算例、算法与失败边界。
闭卷重建线性链CRF与归一化的对象、公式、算例、算法与失败边界。
闭卷重建词性标注与标签体系的对象、公式、算例、算法与失败边界。
闭卷重建命名实体、BIO与跨度解码的对象、公式、算例、算法与失败边界。
闭卷重建弱监督、字典与序列评价的对象、公式、算例、算法与失败边界。
对象:HMM用标签转移和词发射生成观测,假设当前标签只依赖前一标签、当前词只依赖当前标签。;公式:P(x,y)=P(y1) product transitions product emissions。;算例:初始.5、发射.4、转移.2、第二发射.5,两步联合概率.02。;边界:把未知词发射设零;训练与解码标签集合不一致。。
对象:POS、NER等为token/span赋标签;逐token分类忽略标签转移,全局模型用序列得分约束合法结构。;公式:best tags=argmax_y score(x,y) over legal sequences。;算例:BIO中I-PER不能在O后无B-PER直接出现,局部最高分序列可能非法。;边界:子词标签未映回词/span;padding位置计入损失。。
对象:CRF直接给条件序列分布,联合发射/转移特征并用全局配分函数归一;训练需前向—后向。;公式:P(y|x)=exp(score(x,y))/Z(x)。;算例:两条序列未归一权重2和3,第一条概率.4。;边界:只算gold得分不算Z;训练用非法BIO序列进入状态空间。。
对象:Viterbi保存到每位置/状态的最佳路径分数和回指,避免枚举指数序列。;公式:V[t,s]=emission(t,s)+max_prev(V[t-1,prev]+transition)。;算例:某状态两条候选对数分数-3和-2,保留-2及其前驱。;边界:只保留每位置全局一个状态;回指未随最大值更新。。
对象:NER同时识别实体边界和类型;BIO/BILOU编码需合法化并映回原文字符偏移。;公式:entity exact F1 from span+type TP,FP,FN。;算例:金标[0,4)ORG,预测[0,3)ORG,严格跨度不算TP。;边界:只报token准确率;把重叠实体强塞单层BIO不说明丢失。。
对象:词性依语言和标注目的,粗细粒度、兼类与未知词处理影响可比性和下游用途。;公式:accuracy=correct tokens/evaluated tokens under same guideline。;算例:“研究”在“研究问题”是动词,在“研究成果”可作名词修饰,需上下文和指南。;边界:把不同树库标签直接合并;标点/多词表达口径未声明。。
对象:字典、规则和远程监督可扩标注,但覆盖偏差和噪声需建模;评价必须在独立人工金标集。;公式:estimated correct weak labels=accepted×precision_on_audit_sample。;算例:接受1000弱标签,抽检精度.85,预计约850正确。;边界:用同一字典生成训练和测试金标;未匹配样本都标O。。