跳到正文

第1章笔记:语言、文本与数据基础

课程笔记

从语言层级、Unicode、语料、分词、规范化、长尾和评价建立证据链。

关联:章节 第1章 语言、文本与数据基础

第1章笔记:语言、文本与数据基础

本章任务

从语言层级、Unicode、语料、分词、规范化、长尾和评价建立证据链。 先用一条能人工判断的短文本、标签序列、语法树或检索集合建立基准,再让代码输出完整中间证据,最后在真实语料、困难语言切片和生产约束下验收。

七节连接

  • 自然语言、层级与歧义:语言同时具有字符、词法、句法、语义、篇章和语用层级;同一表面串可对应多个结构与意图。 核心关系:interpretation=argmax_y P(y|utterance,context,task)。 算例:“我看见拿望远镜的人”可指我用望远镜看见人,也可指那个人拿着望远镜,缺上下文不能唯一决定。 边界:把一种标注规范当语言真理;离开上下文强行给唯一解释。
  • Unicode、码点与字节:文本存储涉及字节、编码、Unicode码点和用户感知字素簇;字符串长度必须声明在哪一层计数。 核心关系:UTF-8 bytes per code point vary from 1 to 4。 算例:ASCII字母A占1字节,常见汉字在UTF-8占3字节;二者都可各是1个码点。 边界:按字节截断破坏UTF-8;用len码点数当屏幕字符宽度。
  • 语料、样本单位与数据治理:语料不是句子堆积,而是带来源、许可、时间、说话人、领域、去重和划分规则的数据产品。 核心关系:usable corpus=licensed∧traceable∧deduplicated∧representative∧split-safe。 算例:同一新闻转载10次若随机分组,会让近重复跨训练测试并夸大泛化。 边界:爬到即能训练;只按句子随机切分泄漏上下文与作者。
  • 句子切分与基础分词:句号、缩写、小数、URL和多语言标点让句子/词边界依上下文与任务;规则需保留原始偏移。 核心关系:token span=[start,end),detokenize(tokens,spans)=original slice。 算例:“版本2.1发布。”中的小数点不是句末,最后句号才是边界。 边界:正则按所有句点切分;标准化后偏移无法映回原文。
  • 规范化、大小写与可逆性:NFC/NFKC、大小写、全半角、空白和数字规范化会改善统计,也可能删除实体、代码或法律文本差异。 核心关系:normalized form must retain mapping to original offsets when task needs spans。 算例:NFKC可把某些兼容字符合并;若任务区分商标原形,就不能无审计覆盖。 边界:全量小写破坏大小写实体线索;删除标点改变否定或句法。
  • 词表、长尾与未登录词:自然语言词频呈长尾,固定词表会产生OOV;字符/子词可开放组合但增加序列长度。 核心关系:OOV rate=unseen token count/total token count。 算例:测试1000词中80词不在训练词表,OOV率8%。 边界:只报训练词表覆盖;把所有罕见专名合并后仍称实体可恢复。
  • 任务定义、标注与评价协议:分类、序列、跨度、生成和检索任务需要不同标注对象、匹配规则与指标;先定协议再训练。 核心关系:score depends on label ontology+matching rule+denominator。 算例:NER预测“北京大学”而金标“北京”,严格跨度错,重叠匹配可能部分对,必须预先声明。 边界:训练后改匹配规则;只报告最好指标不报告样本和置信区间。

实验要求

运行本章两道Python语言算法实验的四组测试,并新增空文本、Unicode边界、未知词、非法标签、句法歧义、否定、长上下文、低资源语言、域外、证据冲突或提示注入中的至少一种。保存原文hash/offset、Tokenizer、数据与模型版本、随机种子、中间格表/结构/概率、输出、证据和首个偏差。

错题闭环

按字符/token/offset、规范化、概率分母、动态规划状态、标签约束、句法结构、语义作用域、训练测试泄漏、检索召回、引用蕴含、校准、隐私和工具授权分类。更换一个词频、上下文、标签、阈值、候选数、语言或证据版本重做阶段卷;能先预测变化方向,再复算并解释失效,才算掌握。