闭卷重建概率排序原理的对象、公式、算例、算法与失败边界。
信息检索与搜索系统 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建BM25的tf饱和的对象、公式、算例、算法与失败边界。
闭卷重建BM25长度归一b的对象、公式、算例、算法与失败边界。
闭卷重建BM25 IDF与负值边界的对象、公式、算例、算法与失败边界。
闭卷重建完整BM25逐项算分的对象、公式、算例、算法与失败边界。
闭卷重建字段BM25与BM25F的对象、公式、算例、算法与失败边界。
闭卷重建查询似然与平滑的对象、公式、算例、算法与失败边界。
闭卷重建概率模型诊断与参数实验的对象、公式、算例、算法与失败边界。
对象:BM25用k1控制tf边际递减,避免重复词无限线性加分。;公式:tfpart=tf(k1+1)/(tf+k1·norm)。;算例:k1=1.2、norm=1、tf=1时tfpart=2.2/2.2=1;tf趋无穷上限2.2。;边界:k1设负数或线上/离线不同;把上限当最终score忽略IDF。。
对象:在相同检索代价下,按文档相关概率降序能最大化期望相关结果。;公式:若P(R=1|q,d1)>.P(R=1|q,d2),则d1应排前。;算例:文档A相关概率.8、B为.3,A在前的前1期望相关数.8,高于.3。;边界:把未经校准的任意分数称概率;概率随用户任务变化却全局固定。。
对象:不同BM25实现的IDF平滑不同,必须记录公式;极高df词可能得到负或近零权重。;公式:idf=log(1+(N−df+.5)/(df+.5))。;算例:N=100、df=10,idf=log(1+90.5/10.5)≈2.2637。;边界:照搬另一实现参数却公式不同;df统计跨字段口径不一。。
对象:b在不归一与按dl/avgdl归一之间插值。;公式:norm=1−b+b·dl/avgdl。;算例:b=.75、dl=200、avgdl=100,norm=.25+1.5=1.75。;边界:avgdl为0;把字节长度作为token长度。。
对象:标题、正文等字段长度和boost不同,可先各字段归一后合并term证据。;公式:w_t=Σf boost_f·tf_tf/norm_f。;算例:标题tf1、boost3、norm1,正文tf2、boost1、norm2,合并权重3+1=4。;边界:用全文avgdl归一标题;boost过大让标题堆词支配。。
对象:每个query term贡献IDF×tf饱和项,文档分数为各term贡献和。;公式:score=Σt idf_t·tfpart_t。;算例:两个term贡献分别1.2×1.5=1.8与.5×1=.5,总分2.3。;边界:只输出总分无法定位;query重复词被错误重复加权。。
对象:参数k1、b、μ需在验证集按查询切片选择,并保留稳健区而非单点峰值。;公式:gain_slice=M_new_slice−M_base_slice。;算例:总体+0.02但长文档查询−0.08,说明长度归一可能过强。;边界:用测试集选择参数;只报最好点不报邻域敏感性。。
对象:语言模型估计文档生成query的概率;平滑给未见词非零概率。;公式:Dirichlet:P(t|d)=(tf_td+μP(t|C))/(dl+μ)。;算例:tf=2、dl=100、集合概率.01、μ=100,P=(2+1)/200=.015。;边界:直接连乘下溢;未见词概率为0使整query得分负无穷。。