闭卷重建正则表达式与文本模式的对象、公式、算例、算法与失败边界。
自然语言处理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建有限状态自动机与词法识别的对象、公式、算例、算法与失败边界。
闭卷重建形态学、词干与词形还原的对象、公式、算例、算法与失败边界。
闭卷重建中文分词与动态规划的对象、公式、算例、算法与失败边界。
闭卷重建BPE子词学习的对象、公式、算例、算法与失败边界。
闭卷重建Unigram子词模型与分词概率的对象、公式、算例、算法与失败边界。
闭卷重建加权有限状态转换与分词解码的对象、公式、算例、算法与失败边界。
对象:DFA/NFA以状态和转移识别正则语言;确定化与最小化改变实现规模,不改变接受语言。;公式:extended transition delta*(q,string) determines accept state。;算例:从q0读a到q1、再读b到q2且q2接受,则串ab被接受。;边界:把缺失转移默认为接受;epsilon闭包遗漏导致语言变小。。
对象:正则适合局部形式模式,不具备任意嵌套语言能力;贪婪、回溯和Unicode类别影响正确性与成本。;公式:match set={spans accepted by declared pattern and flags}。;算例:模式数字+可匹配“2026”,但若未加边界也会匹配“abc2026x”的子串。;边界:用正则解析任意嵌套括号;忽略全角数字和Unicode边界。。
对象:中文词边界不显式,可把句子看成词图,在词典/统计代价下寻找最优路径。;公式:best[i]=min_j(best[j]+cost(text[j:i]))。;算例:“研究生命”可切“研究/生命”或“研究生/命”,不同词频代价给不同最优路径。;边界:最长匹配当普遍最优;新词出现时词图无可行边。。
对象:屈折改变语法特征,派生改变词义/词类;stemming是表面截断,lemmatization需词性和词典/模型。;公式:surface=form(lemma,morphological features)。;算例:英语saw若作名词词元saw,若作动词过去式词元see,必须看上下文词性。;边界:把better机械还原为bett;不同语言照搬英语后缀规则。。
对象:Unigram模型从大候选词表出发,以token概率给每种切分评分并迭代剪枝。;公式:P(segmentation)=product P(token_i),use log-sum for stability。;算例:切分A概率.4×.2=.08,切分B概率.1×.9=.09,B更优。;边界:直接连乘长序列下溢;剪掉唯一可覆盖字符的token。。
对象:BPE从字符开始迭代合并最高频相邻对,以词表规模换序列长度;合并表必须固定并按顺序应用。;公式:vocab size≈initial symbols+merge count。;算例:初始100字符符号,执行500次有效新合并,词表约600。;边界:在测试集继续学合并造成泄漏;不同Unicode规范用同一表。。
对象:WFST把输入、输出和权重统一为路径,可组合词典、形态和语言模型;权重半环决定求和/最短路语义。;公式:best output=shortest/maximum-weight path under declared semiring。;算例:两路径代价2.3和1.8,最短路选择1.8,不等于概率直接相加。;边界:混用负对数和概率方向;epsilon环导致无限路径。。