闭卷重建embedding与语义空间的对象、公式、算例、算法与失败边界。
信息检索与搜索系统 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建双塔训练与对比损失的对象、公式、算例、算法与失败边界。
闭卷重建向量归一与相似度的对象、公式、算例、算法与失败边界。
闭卷重建ANN召回与速度权衡的对象、公式、算例、算法与失败边界。
闭卷重建混合检索与分数融合的对象、公式、算例、算法与失败边界。
闭卷重建cross-encoder重排的对象、公式、算例、算法与失败边界。
闭卷重建向量检索评测、漂移与安全的对象、公式、算例、算法与失败边界。
对象:双塔独立编码q和d便于预计算,in-batch negatives提高效率但可能含假负例。;公式:L_i=−log exp(sim(q_i,d_i)/τ)/Σj exp(sim(q_i,d_j)/τ)。;算例:正例logit2、一个负例logit1,softmax正例概率e²/(e²+e)≈.7311。;边界:同一相关文档作为另一query负例;batch只含易负例。。
对象:编码器把query/document映射到向量,几何相近表示训练目标下的语义相似而非真理。;公式:q=E_q(text),d=E_d(text)。;算例:“心肌梗死”和“心梗”可能余弦接近,即使没有共享token。;边界:把向量相近解释成事实相同;模型升级复用旧文档向量。。
对象:近似最近邻用图、倒排量化等结构减少搜索,需用exact top-k衡量ANN recall。;公式:ANNRecall@k=|ANN_k∩Exact_k|/k。;算例:exact top10与ANN重合9篇,ANN recall@10=.9。;边界:只用业务relevance评ANN导致混入编码器质量;参数只在平均查询调。。
对象:归一后点积等于余弦;未归一时向量范数会影响排名。;公式:cos(q,d)=q·d/(||q||||d||)。;算例:q=(1,0),d1=(2,0)和d2=(1,1):余弦1与.7071;纯点积2与1。;边界:query归一而document未归一;索引用L2但评测用cos。。
对象:cross-encoder联合读取(q,d)可做细粒度交互,但成本高,通常只重排候选top-N。;公式:final=rerank(q,candidates_N)。;算例:召回N=100、每对推理2ms,串行需200ms;批处理仍受算力和尾延迟约束。;边界:用重排器评自己训练数据;截断把关键段落裁掉。。
对象:稀疏擅长精确词/新实体,稠密擅长语义改写;融合需处理不可比分数。;公式:RRF(d)=Σ_s 1/(k+rank_s(d))。;算例:k=60,某文档在两路排名1和4,RRF=1/61+1/64≈.0320。;边界:直接相加BM25与cos原始分数;一条路失败时未降级。。
对象:语义检索需评专名、数字、否定、多语言、对抗文本和模型/语料漂移。;公式:drift=1−cos(centroid_old,centroid_new)可作一个代理。;算例:旧新质心余弦.95,漂移代理.05;不能单凭它判断相关性下降。;边界:只重编码新增文档导致向量空间混版;语义召回泄露无权限相似文档。。