自然语言处理总笔记
课程笔记用原文—结构—模型—证据—行动链路贯穿全课。
关联:全课程
阅读全文 →用原文—结构—模型—证据—行动链路贯穿全课。
关联:全课程
阅读全文 →语言模型、表示、序列、句法、注意力、检索与生产指标条件表。
关联:全课程
阅读全文 →从语言层级、Unicode、语料、分词、规范化、长尾和评价建立证据链。
关联:章节 第1章 语言、文本与数据基础
阅读全文 →掌握正则、有限状态机、形态学、中文分词、BPE、Unigram与WFST。
关联:章节 第2章 词法、形态与子词算法
阅读全文 →从链式法则和n-gram走到平滑、回退、Kneser–Ney、困惑度与解码。
关联:章节 第3章 统计语言模型
阅读全文 →用共现、PMI、矩阵分解、Word2Vec、子词和上下文化表示学习语义。
关联:章节 第4章 分布语义与词表示
阅读全文 →贯通HMM、Viterbi、CRF、词性、命名实体、BIO和弱监督评价。
关联:章节 第5章 序列标注与结构化预测
阅读全文 →从CFG、CKY和PCFG走到依存、转移系统、歧义与树库评价。
关联:章节 第6章 句法分析
阅读全文 →覆盖逻辑形式、词义、语义角色、指代、篇章、语用和自然语言推理。
关联:章节 第7章 语义、篇章与语用
阅读全文 →用朴素贝叶斯、逻辑回归、TF-IDF、主题、关系、事件与校准建立基线。
关联:章节 第8章 文本分类与信息抽取
阅读全文 →推导编码器—解码器、注意力、Transformer、位置、掩码、解码和评价。
关联:章节 第9章 序列到序列、注意力与Transformer
阅读全文 →学习预训练目标、Tokenizer、数据、微调、提示、对齐和推理效率。
关联:章节 第10章 预训练语言模型与大模型
阅读全文 →贯通稀疏/稠密检索、重排、抽取/生成问答、RAG和端到端归因。
关联:章节 第11章 检索、问答与RAG
阅读全文 →覆盖机器翻译、摘要事实性、对话状态、可控生成和低资源迁移。
关联:章节 第12章 翻译、摘要、对话与多语言生成
阅读全文 →建立事实核验、公平、隐私、提示注入防护、可靠评测、服务与监控。
关联:章节 第13章 可信NLP、安全与生产系统
阅读全文 →交付任务、语料、模型、结构/检索证据、鲁棒、安全、部署与答辩。
关联:章节 第14章 端到端自然语言处理综合项目
阅读全文 →