闭卷重建AP与MAP的对象、公式、算例、算法与失败边界。
信息检索与搜索系统 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建NDCG的gain与discount选择的对象、公式、算例、算法与失败边界。
闭卷重建统计显著性与查询配对的对象、公式、算例、算法与失败边界。
闭卷重建标注一致性与分歧的对象、公式、算例、算法与失败边界。
闭卷重建池化评测与未判文档的对象、公式、算例、算法与失败边界。
闭卷重建查询级误差分析的对象、公式、算例、算法与失败边界。
闭卷重建评测数据版本与反查的对象、公式、算例、算法与失败边界。
对象:分级标注经gain映射,位置经discount衰减;公式改变会改变系统偏好。;公式:gain=2^rel−1,discount=1/log2(i+1)。;算例:rel=2在第1位贡献3;同文档在第3位贡献3/log2(4)=1.5。;边界:不同团队使用线性gain和指数gain却直接比较数值。。
对象:AP在每个相关文档出现位置取precision再平均,MAP再跨查询平均。;公式:AP=Σk P@k·rel_k/R。;算例:相关序列[1,0,1],R=2:AP=(1/1+2/3)/2=.8333。;边界:只除返回中的相关数抬高AP;无相关查询处理不一致。。
对象:一致率受类别基准率影响,可用kappa扣除偶然一致并保留分歧原因。;公式:κ=(p_o−p_e)/(1−p_e)。;算例:观察一致.8、偶然一致.5,κ=(.8−.5)/.5=.6。;边界:仲裁者看系统排名造成偏见;只报总一致率。。
对象:检索指标按同一查询配对,新旧差值的分布比独立均值更有效。;公式:Δq=M_B(q)−M_A(q),检验/区间作用于{Δq}。;算例:三个查询差值[.1,.0,−.04],平均提升.02,但存在输的查询。;边界:把每篇文档当独立样本;只看p值不看提升大小。。
对象:平均指标必须下钻到query,按无召回、错排序、意图错、时效错、垃圾/安全等分类。;公式:impact(q)=traffic(q)×loss(q)。;算例:查询A损失.2、流量1000影响200;B损失.8、流量100影响80,应先修A。;边界:只修最戏剧化案例;组件归因没有反事实验证。。
对象:pooling汇集多系统top结果标注;未判文档不等于不相关,系统差异大时会偏。;公式:pool=union_s top_k(s)。;算例:3个系统top10并集只有22篇而非30,说明有8个重复结果。;边界:把unjudged全判0,惩罚检索到新相关文档的系统。。
对象:每个指标应反查查询集、语料、标注、运行、代码和参数版本。;公式:result=F(qset,corpus,qrels,run,evaluator)。;算例:同run换qrels版本后NDCG变化,不应归因排序代码。;边界:只存汇总CSV;测试集更新却沿用旧基线数。。