闭卷重建检索任务、语料与信息需求的对象、公式、算例、算法与失败边界。
信息检索与搜索系统 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建查询、文档与相关性判断的对象、公式、算例、算法与失败边界。
闭卷重建精确率、召回率与F值的对象、公式、算例、算法与失败边界。
闭卷重建排名位置、MRR与Success@k的对象、公式、算例、算法与失败边界。
闭卷重建DCG、NDCG与分级相关性的对象、公式、算例、算法与失败边界。
闭卷重建离线测试集与查询采样的对象、公式、算例、算法与失败边界。
闭卷重建基线、误差分类与实验契约的对象、公式、算例、算法与失败边界。
对象:query是用户行为产生的短表达,document是可检索单元,relevance judgment是对(q,d)在任务下的等级判断。;公式:J={(q,d,r)},其中r是明确等级而非搜索结果点击本身。;算例:“python list去重”与一篇只讲安装Python的文档词有重合但任务不相关;讲set顺序边界的文档更相关。;边界:把点击直接当真值;把整站网页合成一篇导致相关段落被稀释。。
对象:检索系统接收信息需求的可观测表达query,在语料集合D中返回有序文档列表;相关性必须绑定用户、任务和时间。;公式:rank(q,D)→(d1,d2,…),rel(q,d,u,t)∈{0,1,2,…};算例:用户输入“苹果发布会”可能要新闻、直播或历史资料;同一词串在发布会当天与半年后相关文档不同。;边界:把关键词重合当相关性;用离线标注替代真实用户任务。。
对象:首个相关结果的位置直接影响导航型查询;MRR对每个查询取首相关名次倒数再平均。;公式:RR(q)=1/rank_first,MRR=Σq RR(q)/|Q|。;算例:三个查询首相关位置1、2、5,MRR=(1+1/2+1/5)/3=0.5667;Success@2为2/3。;边界:一个查询有很多相关文档时MRR忽略第二个以后;把未命中查询从分母删除。。
对象:precision回答返回结果中多少相关,recall回答全部相关文档找回多少;二者分母不同。;公式:P=TP/(TP+FP),R=TP/(TP+FN),F1=2PR/(P+R)。;算例:返回10篇中6篇相关,语料共8篇相关:P=0.6,R=0.75,F1=2×0.6×0.75/1.35=0.6667。;边界:只报准确率;语料相关总数未知却声称计算完整recall。。
对象:测试查询必须代表真实频率、尾部、语言和任务,且与训练调参隔离。;公式:Metric=Σq wq·metric(q),Σq wq=1。;算例:头部查询占80%且NDCG=.9,尾部占20%且NDCG=.4,加权总体=.8×.9+.2×.4=.8。;边界:只采热门短查询;反复看测试集挑参数造成过拟合。。
对象:DCG让高相关文档和靠前位置贡献更大,NDCG用理想排序归一化到0至1。;公式:DCG@k=Σi(2^rel_i−1)/log2(i+1),NDCG=DCG/IDCG。;算例:相关等级[3,2,0]时DCG=7+3/log2(3)+0≈8.8928;理想序相同,NDCG=1。;边界:不同查询标注尺度不同却直接比较DCG;IDCG=0时硬除。。
对象:基线提供可比较下限;误差分析把失败分为召回、排序、理解、数据、时效和展示。;公式:Δ=(M_new−M_base),relative_gain=Δ/M_base。;算例:基线NDCG=.50,新系统=.55,绝对提升.05、相对提升10%;不能写成提升5%。;边界:新旧系统用不同语料;只分析赢的查询。。