闭卷重建稀疏检索、倒排索引与BM25的对象、公式、算例、算法与失败边界。
自然语言处理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建稠密检索与双编码器的对象、公式、算例、算法与失败边界。
闭卷重建混合检索、重排与候选预算的对象、公式、算例、算法与失败边界。
闭卷重建抽取式问答与跨度概率的对象、公式、算例、算法与失败边界。
闭卷重建生成式问答与证据约束的对象、公式、算例、算法与失败边界。
闭卷重建RAG分块、上下文组装与冲突的对象、公式、算例、算法与失败边界。
闭卷重建检索问答评价与失败归因的对象、公式、算例、算法与失败边界。
对象:双编码器独立编码查询和文档,以向量相似召回;负样本、池化和索引版本决定语义空间。;公式:score(q,d)=cosine or dot product of embeddings。;算例:单位向量点积.8则余弦.8;若未归一,点积还受范数影响。;边界:文档encoder升级但索引未重建;测试问答对进入负样本挖掘。。
对象:倒排索引从词到文档列表,BM25结合词频饱和、逆文档频率和长度归一形成可解释基线。;公式:idf≈log((N-df+0.5)/(df+0.5)) under BM25 variant。;算例:稀有词df小则idf高;同词在超长文档中的边际贡献被长度归一抑制。;边界:索引和查询tokenization不同;把停用词全部删除损伤短语。。
对象:抽取QA在给定上下文预测起止位置,需保证end≥start并处理无答案、长文切窗与跨窗口。;公式:score(span i,j)=start_score_i+end_score_j with legal constraints。;算例:start2分3、end4分2,总span分5;非法end<start应排除。;边界:答案被tokenization拆分后偏移错;每窗概率直接横比未校准。。
对象:稀疏擅长精确词,稠密擅长语义;融合后cross-encoder重排有限候选,召回上限受第一阶段限制。;公式:final recall≤candidate-stage recall。;算例:第一阶段未召回答案文档,重排器再强也无法恢复。;边界:只报重排后MRR不报候选召回;并集未去重挤占预算。。
对象:RAG把检索文档切块、召回、重排并组装上下文;chunk边界、版本、新鲜度和互相冲突需显式处理。;公式:usable context=top evidence within token budget after dedup/version/conflict checks。;算例:预算1000 token,系统/问题200,若每块200,最多装4块且未计分隔符。;边界:把相邻重叠块当独立证据;旧政策与新政策混合生成。。
对象:生成QA可综合多段信息,但输出不天然受证据约束;必须区分答案正确、证据充分和引用对应。;公式:grounded answer=answer correctness∧evidence support∧citation alignment。;算例:答案数字正确但引用段没有该数字,不能算有根据。;边界:模型参数知识覆盖检索证据却无提示;引用只指整页无法核对。。
对象:端到端失败可来自语料缺失、索引、召回、重排、阅读、生成或引用;只看答案分数无法定位。;公式:end success requires corpus coverage×retrieval×reader/generator×policy chain。;算例:100问中90有证据、其中80召回、其中70回答正确,端到端70%。;边界:用生成器补猜掩盖召回失败;答案近似匹配把关键数字错算对。。