从语言层级、Unicode、语料、分词、规范化、长尾和评价建立证据链。
7 讲掌握正则、有限状态机、形态学、中文分词、BPE、Unigram与WFST。
7 讲从链式法则和n-gram走到平滑、回退、Kneser–Ney、困惑度与解码。
7 讲用共现、PMI、矩阵分解、Word2Vec、子词和上下文化表示学习语义。
7 讲贯通HMM、Viterbi、CRF、词性、命名实体、BIO和弱监督评价。
7 讲从CFG、CKY和PCFG走到依存、转移系统、歧义与树库评价。
7 讲覆盖逻辑形式、词义、语义角色、指代、篇章、语用和自然语言推理。
7 讲用朴素贝叶斯、逻辑回归、TF-IDF、主题、关系、事件与校准建立基线。
7 讲推导编码器—解码器、注意力、Transformer、位置、掩码、解码和评价。
7 讲学习预训练目标、Tokenizer、数据、微调、提示、对齐和推理效率。
7 讲贯通稀疏/稠密检索、重排、抽取/生成问答、RAG和端到端归因。
7 讲覆盖机器翻译、摘要事实性、对话状态、可控生成和低资源迁移。
7 讲建立事实核验、公平、隐私、提示注入防护、可靠评测、服务与监控。
7 讲交付任务、语料、模型、结构/检索证据、鲁棒、安全、部署与答辩。
7 讲