闭卷重建词袋与向量空间的对象、公式、算例、算法与失败边界。
信息检索与搜索系统 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建TF、对数TF与饱和的对象、公式、算例、算法与失败边界。
闭卷重建IDF与稀有词的对象、公式、算例、算法与失败边界。
闭卷重建TF-IDF字段权重的对象、公式、算例、算法与失败边界。
闭卷重建余弦相似度与归一化的对象、公式、算例、算法与失败边界。
闭卷重建文档长度与pivot normalization的对象、公式、算例、算法与失败边界。
闭卷重建稀疏评分与top-k堆的对象、公式、算例、算法与失败边界。
对象:原始tf强调重复次数;log或饱和变换降低堆词带来的线性增长。;公式:w_tf=1+log(tf)(tf>0)。;算例:tf=1权重1;tf=e时权重2;出现次数乘e只增加1,不再线性。;边界:tf=0仍套log;用重复关键词无限提升得分。。
对象:每文档映射到词项维度向量,忽略词序但保留权重;query用同一词典和规范化。;公式:d=(w_1,…,w_|V|),score常用cos(q,d)。;算例:词典[a,b,c],文档“a a c”词频向量(2,0,1)。;边界:query和document使用不同分词/词典版本;把缺失维当负值。。
对象:term权重常为tf变换×idf,标题/正文可分字段后线性组合。;公式:score=Σf b_f Σt tfidf(t,d_f)tfidf(t,q)。;算例:标题命中2分、正文命中1分,权重标题3正文1,总贡献=3×2+1×1=7。;边界:把boost当概率;字段重复存储使同一文本被算两次。。
对象:IDF降低高df词权重,具体平滑公式必须固定并与实现一致。;公式:idf=log((N+1)/(df+1))+1。;算例:N=99、df=9,idf=log(100/10)+1≈3.3026(自然对数)。;边界:df>N或N口径含已删除文档;不同公式离线/线上混用。。
对象:长文档包含更多词也更易偶然命中,需要长度归一但不能过度惩罚真实长文档。;公式:norm=(1−s)+s·dl/avgdl。;算例:s=.2、dl=200、avgdl=100,norm=.8+.2×2=1.2。;边界:字符长度与token长度混用;avgdl未随语料更新。。
对象:余弦用点积除以两个L2范数,比较方向而弱化绝对长度。;公式:cos(q,d)=q·d/(||q||||d||)。;算例:q=(1,1),d=(2,0),点积2,范数√2与2,cos=1/√2≈.7071。;边界:忘记归一化变成纯点积;零query导致除零。。
对象:无需给每篇文档建稠密向量;遍历query term posting累加score,用大小k最小堆保留top-k。;公式:复杂度近似Σt df_t + C log k。;算例:候选得分[1,5,2,4]取top2,最小堆最后保留4和5。;边界:未命中文档仍分配全词表向量;相同分数排序不稳定导致分页重复。。