跳到正文

自然语言处理总笔记

课程笔记

用原文—结构—模型—证据—行动链路贯穿全课。

关联:全课程

自然语言处理总笔记

从原文到行动的一条主线

自然语言处理面对的不是干净token列表,而是某个人在具体时间、语言、上下文和社会关系中留下的字节。系统先解码Unicode并保留原文偏移,再完成规范化、分词、词法和结构分析;统计/神经模型依据语料与上下文输出标签、结构、检索证据或生成文本;最后业务规则决定是否展示、执行、拒答或交给人工。任何一步的版本和假设变化都会改变最终含义。

固定解题顺序

先写用户任务、输入来源、上下文、错误代价和敏感数据;明确字符、token、span、标签/树/实体或主张的schema;写概率、动态规划或注意力关系的条件;手算一条最小语句;让代码输出格表、回指、结构、分数、证据和offset;最后用歧义、否定、未知词、长文本、低资源语言、域外和恶意文档做失败回放。只给大模型名或流畅回答不合格。

传统方法与大模型怎样连接

正则和有限状态机处理局部形式,动态规划处理分词、Viterbi和句法,n-gram建立概率基线,向量表示与线性模型形成可解释分类器。注意力和Transformer扩大上下文建模,预训练模型提供迁移能力,检索和工具把外部知识/动作接入系统。大模型没有取消Unicode、offset、标注、检索召回、结构约束和评价协议;它只是把许多特征和条件概率参数化在更大模型中。

数据与评价纪律

语料保存来源、许可、语言、时间、主体、hash、去重、划分和删除;Tokenizer、标签体系、提示、索引和评测脚本都是版本化制品。分类报告逐类PR/F1和校准,序列/结构报告严格span或树指标,检索报告候选召回与排序,生成报告事实、证据、任务成功和人工一致率。测试集不能参与词表、IDF、负样本、提示或阈值选择。

可信生产边界

概率高不等于事实真,注意力图不等于因果解释,引用存在不等于主张受支持,结构化JSON也不等于业务安全。生产系统需要主张级证据、域外/低置信拒答、最差语言/群体切片、PII最小化、提示注入隔离、工具最小授权、端到端延迟/成本、灰度和回滚。线上错例需人工审计后才可进入训练。

反查模板

从最终标签/回答/工具动作向后查阈值、证据、检索/结构、模型/提示、Tokenizer、规范化、数据版本和原文hash;从原文向前重放。找到首个偏离的字符offset、条件概率、标签约束、证据版本或安全策略,修复后把最短反例加入独立回归集。