闭卷重建分布语义与上下文矩阵的对象、公式、算例、算法与失败边界。
自然语言处理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建PMI、PPMI与稀有事件的对象、公式、算例、算法与失败边界。
闭卷重建矩阵分解与低维语义的对象、公式、算例、算法与失败边界。
闭卷重建Word2Vec与负采样的对象、公式、算例、算法与失败边界。
闭卷重建余弦相似、类比与近邻的对象、公式、算例、算法与失败边界。
闭卷重建子词与字符表示的对象、公式、算例、算法与失败边界。
闭卷重建上下文化表示、多义与偏差的对象、公式、算例、算法与失败边界。
对象:PMI比较联合概率与独立假设,PPMI截断负值;稀有共现可产生不稳定高PMI。;公式:PMI(w,c)=log(P(w,c)/(P(w)P(c)))。;算例:若联合.1、边缘各.2,比例2.5,PMI=ln2.5。;边界:计数1的偶然pair被判最相关;混用log底比较绝对值。。
对象:分布假设用词的上下文使用模式近似语义;窗口、方向、距离权重和语料域决定矩阵。;公式:cooccurrence C(w,c)=weighted count within declared window。;算例:窗口1中“猫 吃 鱼”,猫与吃共现1次,猫与鱼不直接共现。;边界:跨文档边界计共现;把高频功能词主导的相似当语义。。
对象:skip-gram用中心词预测上下文,负采样把大softmax变为正负二分类;采样分布影响表示。;公式:objective=log sigma(v_c·v_o)+Σ log sigma(-v_c·v_neg)。;算例:一个正样本配5个负样本,共6个二分类项。;边界:测试词参与训练;把同句真实上下文抽成负样本不处理。。
对象:SVD把稀疏共现矩阵近似为低秩表示,维数控制压缩与信息损失;符号/旋转不影响某些关系。;公式:C≈U_k Sigma_k V_k^T。;算例:原矩阵1000×500、取k=50,词表示U_k Sigma_k为1000×50。;边界:在全数据拟合分解后评测试集;只看二维图主观挑结果。。
对象:字符n-gram/子词共享词形信息,帮助稀有词和拼写变化,但可能把形似而义异的词拉近。;公式:word vector=sum/average of subword vectors。;算例:词由4个子词向量平均,每维和为8,则该维值2。;边界:不加边界导致前后缀混淆;中文字符部件与词义被简单等同。。
对象:余弦比较方向忽略范数,近邻结果受中心化、hubness和词频影响;向量类比不是逻辑证明。;公式:cos(a,b)=a·b/(||a||||b||)。;算例:a=(1,0)、b=(1,1),余弦1/sqrt2≈.7071。;边界:零向量除法;看到一个著名类比成功就称理解关系。。
对象:上下文化模型让同一词在不同句子产生不同表示;相似度仍受训练语料偏差和层选择影响。;公式:representation h_i=f(tokens,position,context,model_version)。;算例:“银行利率”和“河流银行”中目标词表示应因语境分离,而静态向量只有一个点。;边界:把embedding相似当客观价值判断;不同tokenizer位置错配。。