闭卷重建自然语言、层级与歧义的对象、公式、算例、算法与失败边界。
自然语言处理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建Unicode、码点与字节的对象、公式、算例、算法与失败边界。
闭卷重建语料、样本单位与数据治理的对象、公式、算例、算法与失败边界。
闭卷重建句子切分与基础分词的对象、公式、算例、算法与失败边界。
闭卷重建规范化、大小写与可逆性的对象、公式、算例、算法与失败边界。
闭卷重建词表、长尾与未登录词的对象、公式、算例、算法与失败边界。
闭卷重建任务定义、标注与评价协议的对象、公式、算例、算法与失败边界。
对象:文本存储涉及字节、编码、Unicode码点和用户感知字素簇;字符串长度必须声明在哪一层计数。;公式:UTF-8 bytes per code point vary from 1 to 4。;算例:ASCII字母A占1字节,常见汉字在UTF-8占3字节;二者都可各是1个码点。;边界:按字节截断破坏UTF-8;用len码点数当屏幕字符宽度。。
对象:语言同时具有字符、词法、句法、语义、篇章和语用层级;同一表面串可对应多个结构与意图。;公式:interpretation=argmax_y P(y|utterance,context,task)。;算例:“我看见拿望远镜的人”可指我用望远镜看见人,也可指那个人拿着望远镜,缺上下文不能唯一决定。;边界:把一种标注规范当语言真理;离开上下文强行给唯一解释。。
对象:句号、缩写、小数、URL和多语言标点让句子/词边界依上下文与任务;规则需保留原始偏移。;公式:token span=[start,end),detokenize(tokens,spans)=original slice。;算例:“版本2.1发布。”中的小数点不是句末,最后句号才是边界。;边界:正则按所有句点切分;标准化后偏移无法映回原文。。
对象:语料不是句子堆积,而是带来源、许可、时间、说话人、领域、去重和划分规则的数据产品。;公式:usable corpus=licensed∧traceable∧deduplicated∧representative∧split-safe。;算例:同一新闻转载10次若随机分组,会让近重复跨训练测试并夸大泛化。;边界:爬到即能训练;只按句子随机切分泄漏上下文与作者。。
对象:自然语言词频呈长尾,固定词表会产生OOV;字符/子词可开放组合但增加序列长度。;公式:OOV rate=unseen token count/total token count。;算例:测试1000词中80词不在训练词表,OOV率8%。;边界:只报训练词表覆盖;把所有罕见专名合并后仍称实体可恢复。。
对象:NFC/NFKC、大小写、全半角、空白和数字规范化会改善统计,也可能删除实体、代码或法律文本差异。;公式:normalized form must retain mapping to original offsets when task needs spans。;算例:NFKC可把某些兼容字符合并;若任务区分商标原形,就不能无审计覆盖。;边界:全量小写破坏大小写实体线索;删除标点改变否定或句法。。
对象:分类、序列、跨度、生成和检索任务需要不同标注对象、匹配规则与指标;先定协议再训练。;公式:score depends on label ontology+matching rule+denominator。;算例:NER预测“北京大学”而金标“北京”,严格跨度错,重叠匹配可能部分对,必须预先声明。;边界:训练后改匹配规则;只报告最好指标不报告样本和置信区间。。