第4章笔记:分布语义与词表示
课程笔记用共现、PMI、矩阵分解、Word2Vec、子词和上下文化表示学习语义。
关联:章节 第4章 分布语义与词表示
第4章笔记:分布语义与词表示
本章任务
用共现、PMI、矩阵分解、Word2Vec、子词和上下文化表示学习语义。 先用一条能人工判断的短文本、标签序列、语法树或检索集合建立基准,再让代码输出完整中间证据,最后在真实语料、困难语言切片和生产约束下验收。
七节连接
- 分布语义与上下文矩阵:分布假设用词的上下文使用模式近似语义;窗口、方向、距离权重和语料域决定矩阵。 核心关系:cooccurrence C(w,c)=weighted count within declared window。 算例:窗口1中“猫 吃 鱼”,猫与吃共现1次,猫与鱼不直接共现。 边界:跨文档边界计共现;把高频功能词主导的相似当语义。
- PMI、PPMI与稀有事件:PMI比较联合概率与独立假设,PPMI截断负值;稀有共现可产生不稳定高PMI。 核心关系:PMI(w,c)=log(P(w,c)/(P(w)P(c)))。 算例:若联合.1、边缘各.2,比例2.5,PMI=ln2.5。 边界:计数1的偶然pair被判最相关;混用log底比较绝对值。
- 矩阵分解与低维语义:SVD把稀疏共现矩阵近似为低秩表示,维数控制压缩与信息损失;符号/旋转不影响某些关系。 核心关系:C≈U_k Sigma_k V_k^T。 算例:原矩阵1000×500、取k=50,词表示U_k Sigma_k为1000×50。 边界:在全数据拟合分解后评测试集;只看二维图主观挑结果。
- Word2Vec与负采样:skip-gram用中心词预测上下文,负采样把大softmax变为正负二分类;采样分布影响表示。 核心关系:objective=log sigma(v_c·v_o)+Σ log sigma(-v_c·v_neg)。 算例:一个正样本配5个负样本,共6个二分类项。 边界:测试词参与训练;把同句真实上下文抽成负样本不处理。
- 余弦相似、类比与近邻:余弦比较方向忽略范数,近邻结果受中心化、hubness和词频影响;向量类比不是逻辑证明。 核心关系:cos(a,b)=a·b/(||a||||b||)。 算例:a=(1,0)、b=(1,1),余弦1/sqrt2≈.7071。 边界:零向量除法;看到一个著名类比成功就称理解关系。
- 子词与字符表示:字符n-gram/子词共享词形信息,帮助稀有词和拼写变化,但可能把形似而义异的词拉近。 核心关系:word vector=sum/average of subword vectors。 算例:词由4个子词向量平均,每维和为8,则该维值2。 边界:不加边界导致前后缀混淆;中文字符部件与词义被简单等同。
- 上下文化表示、多义与偏差:上下文化模型让同一词在不同句子产生不同表示;相似度仍受训练语料偏差和层选择影响。 核心关系:representation h_i=f(tokens,position,context,model_version)。 算例:“银行利率”和“河流银行”中目标词表示应因语境分离,而静态向量只有一个点。 边界:把embedding相似当客观价值判断;不同tokenizer位置错配。
实验要求
运行本章两道Python语言算法实验的四组测试,并新增空文本、Unicode边界、未知词、非法标签、句法歧义、否定、长上下文、低资源语言、域外、证据冲突或提示注入中的至少一种。保存原文hash/offset、Tokenizer、数据与模型版本、随机种子、中间格表/结构/概率、输出、证据和首个偏差。
错题闭环
按字符/token/offset、规范化、概率分母、动态规划状态、标签约束、句法结构、语义作用域、训练测试泄漏、检索召回、引用蕴含、校准、隐私和工具授权分类。更换一个词频、上下文、标签、阈值、候选数、语言或证据版本重做阶段卷;能先预测变化方向,再复算并解释失效,才算掌握。