自然语言处理公式速查
公式表语言模型、表示、序列、句法、注意力、检索与生产指标条件表。
关联:全课程
- 符号说明
P;H;PP;PMI;V;Z;BIO;TP;FP;FN;Q;K;V;MRR;F1
- 使用前提
程序设计、数据结构、离散数学、线性代数、概率统计与机器学习基础。
- 适用范围
语言、原文/上下文、token/span、数据模型版本和评测协议明确时使用。
自然语言处理公式速查
| 模块 | 核心关系 | 使用前检查 |
|---|---|---|
| 语言模型 | P(w1:n)=product P(w_i | history) |
| n-gram MLE | count(h,w)/count(h) | 边界、OOV和平滑 |
| 插值 | Σ lambda_k P_k,Σlambda=1 | 各阶归一与权重 |
| 困惑度 | exp(-mean log P(token)) | 同tokenization与对数底 |
| PMI | log(P(w,c)/(P(w)P(c))) | 稀有计数和平滑 |
| 余弦 | a·b/( | |
| HMM | initial×emissions×transitions | 马尔可夫和发射假设 |
| Viterbi | V_t(s)=emit+max_prev(V+trans) | 回指与合法标签 |
| CRF | exp(score)/Z(x) | 配分函数和状态空间 |
| CKY | chart span+split+rule | CNF、端点和一元规则 |
| F1 | 2TP/(2TP+FP+FN) | 严格span/type匹配 |
| Attention | softmax(QK^T/sqrt(d))V | mask、shape、位置 |
| RAG | coverage→recall→rerank→generation | 版本、冲突和引用 |
| 业务成本 | FP c_FP+FN c_FN | 部署先验和阈值 |
快速判错
字节、码点和字素簇不是一回事;规范化可能改变意义和offset;高阶n-gram训练分数好不代表泛化;词向量类比不是逻辑推理;BIO逐token准确率不能替代实体F1;句法树概率高不代表语义唯一;注意力权重不是解释证明;预训练低loss不是事实可靠;检索没召回时生成器无法凭引用修复;引用相关不等于蕴含;总体指标不能替代低资源语言和最差群体。
闭卷作答
先写原文、上下文、语言、token/span/schema和数据版本,再写公式、逐行中间量、输出与证据,最后给复杂度、歧义/域外/攻击反例、修复和回归。所有生成结论需标事实与引用,所有工具动作需经过授权与参数验证。