闭卷重建语言模型与链式法则的对象、公式、算例、算法与失败边界。
自然语言处理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建n-gram计数与最大似然的对象、公式、算例、算法与失败边界。
闭卷重建马尔可夫假设与模型阶数的对象、公式、算例、算法与失败边界。
闭卷重建加k平滑与概率质量的对象、公式、算例、算法与失败边界。
闭卷重建回退、插值与未知历史的对象、公式、算例、算法与失败边界。
闭卷重建Kneser–Ney与续接概率的对象、公式、算例、算法与失败边界。
闭卷重建交叉熵、困惑度与解码的对象、公式、算例、算法与失败边界。
对象:n-gram用有限历史近似完整上下文,MLE由条件计数比得到;未见组合概率为零。;公式:P_MLE(w|h)=count(h,w)/count(h)。;算例:历史h出现10次,其中接w3次,MLE=.3。;边界:训练测试标记规则不同;把文档边界跨接成伪n-gram。。
对象:语言模型给序列概率,可用链式法则分解为逐位置条件概率;概率口径必须包括起止符。;公式:P(w1...wn)=product_i P(w_i|w_<i)。;算例:P(我)=.2,P(来|我)=.5,P(了|我来)=.4,序列概率.04。;边界:只乘词频不归一;漏掉EOS使不同长度不可比。。
对象:加k给未见事件伪计数并重新归一,会从已见事件转移概率质量;k大小影响偏差。;公式:P=(count+k)/(history_count+kV)。;算例:count=3、history=10、V=5、k=1,概率4/15≈.2667。;边界:只给分子加k不改分母;大词表用加一严重过平滑。。
对象:更高阶n-gram保留更多局部上下文但参数更稀疏;阶数需用验证集和领域切片选择。;公式:k-order approximation P(w_i|w_<i)≈P(w_i|w_{i-k:i-1})。;算例:三元模型看前2词;句首需补2个BOS符号。;边界:只因训练困惑度下降选择高阶;稀有历史全部零概率。。
对象:Kneser–Ney折扣高阶计数,并让低阶概率反映一个词出现在多少种不同历史后,而非总频次。;公式:P_cont(w)=distinct histories preceding w/total distinct bigrams。;算例:词w出现在4种历史后,总不同bigram20,续接概率.2。;边界:把普通unigram频率冒充续接概率;折扣后概率和不为1。。
对象:回退在高阶无可靠计数时用低阶,插值始终混合多个阶;权重必须非负且和为1。;公式:P=lambda3 P3+lambda2 P2+lambda1 P1。;算例:权重.5,.3,.2,概率.4,.2,.1,混合=.28。;边界:权重按词改变却不重新归一;回退质量未扣除已分配概率。。
对象:平均负对数概率衡量预测难度,困惑度是其指数;比较必须用相同tokenization、对数底和序列集合。;公式:PP=exp(-(1/N)Σ ln P(token_i))。;算例:平均负自然对数为ln4,困惑度4。;边界:不同词表困惑度直接横比;删除OOV句子后报告更低PP。。