跳到正文

自然语言处理公式速查

公式表

语言模型、表示、序列、句法、注意力、检索与生产指标条件表。

关联:全课程

符号说明

P;H;PP;PMI;V;Z;BIO;TP;FP;FN;Q;K;V;MRR;F1

使用前提

程序设计、数据结构、离散数学、线性代数、概率统计与机器学习基础。

适用范围

语言、原文/上下文、token/span、数据模型版本和评测协议明确时使用。

自然语言处理公式速查

模块 核心关系 使用前检查
语言模型 P(w1:n)=product P(w_i history)
n-gram MLE count(h,w)/count(h) 边界、OOV和平滑
插值 Σ lambda_k P_k,Σlambda=1 各阶归一与权重
困惑度 exp(-mean log P(token)) 同tokenization与对数底
PMI log(P(w,c)/(P(w)P(c))) 稀有计数和平滑
余弦 a·b/(
HMM initial×emissions×transitions 马尔可夫和发射假设
Viterbi V_t(s)=emit+max_prev(V+trans) 回指与合法标签
CRF exp(score)/Z(x) 配分函数和状态空间
CKY chart span+split+rule CNF、端点和一元规则
F1 2TP/(2TP+FP+FN) 严格span/type匹配
Attention softmax(QK^T/sqrt(d))V mask、shape、位置
RAG coverage→recall→rerank→generation 版本、冲突和引用
业务成本 FP c_FP+FN c_FN 部署先验和阈值

快速判错

字节、码点和字素簇不是一回事;规范化可能改变意义和offset;高阶n-gram训练分数好不代表泛化;词向量类比不是逻辑推理;BIO逐token准确率不能替代实体F1;句法树概率高不代表语义唯一;注意力权重不是解释证明;预训练低loss不是事实可靠;检索没召回时生成器无法凭引用修复;引用相关不等于蕴含;总体指标不能替代低资源语言和最差群体。

闭卷作答

先写原文、上下文、语言、token/span/schema和数据版本,再写公式、逐行中间量、输出与证据,最后给复杂度、歧义/域外/攻击反例、修复和回归。所有生成结论需标事实与引用,所有工具动作需经过授权与参数验证。