闭卷重建排序特征与point-in-time的对象、公式、算例、算法与失败边界。
信息检索与搜索系统 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建pointwise排序的对象、公式、算例、算法与失败边界。
闭卷重建pairwise排序的对象、公式、算例、算法与失败边界。
闭卷重建listwise与NDCG目标的对象、公式、算例、算法与失败边界。
闭卷重建负例采样与位置偏置的对象、公式、算例、算法与失败边界。
闭卷重建特征归一、缺失与单调约束的对象、公式、算例、算法与失败边界。
闭卷重建LTR评测、消融与解释的对象、公式、算例、算法与失败边界。
对象:pointwise把每个(q,d)当回归/分类样本预测相关标签,简单但未直接优化相对次序。;公式:min Σ_{q,d} L(f(x_qd),y_qd)。;算例:同query文档A标签3预测2.5、B标签0预测.5,平方损失=.25+.25=.5。;边界:文档样本随机切分让同query泄漏;类别不平衡只预测0。。
对象:特征包括query-doc匹配、质量、时效、行为和上下文;训练样本只能使用当时可得值。;公式:x(q,d,t)=features available before t。;算例:用点击后累计停留时长训练点击排序是标签后信息泄漏。;边界:用未来文档质量分;训练和线上字段归一不同。。
对象:listwise以完整候选列表为单位近似优化排序指标,需处理截断和不可导位置。;公式:softmax(s_i)=exp(s_i)/Σj exp(s_j)。;算例:分数[0,ln2]的softmax概率[1/3,2/3],高分文档获双倍概率。;边界:把不同query文档拼一个softmax;截断候选导致训练分布偏。。
对象:pairwise学习相关文档分数高于不相关文档,常用logistic pair loss。;公式:L=log(1+exp(−(s_pos−s_neg)))。;算例:s_pos=2、s_neg=1,差1,损失log(1+e^-1)≈.3133。;边界:跨query构造pair没有意义;热门query产生平方级pair支配训练。。
对象:跨特征尺度需要训练期统计;缺失应有语义,质量/新鲜度等可施加单调先验。;公式:z=(x−μ_train)/σ_train。;算例:训练μ=10、σ=2,线上x=14得到z=2;不能用线上批次重算μ。;边界:缺失填0却0是有效值;树模型分裂方向让质量越高分越低。。
对象:未点击不等于不相关;负例需结合曝光,位置偏置可用随机化或倾向权重校正。;公式:IPS weight=1/P(examined at position)。;算例:第1位检查概率1权重1,第5位检查概率.2权重5;后位点击应得到更大校正权重。;边界:把未曝光文档当负例;小倾向导致巨大方差。。
对象:学习排序需相对强基线做特征组消融、查询切片和稳定性分析,特征重要性不是因果。;公式:ablation_gain=M_full−M_without_group。;算例:完整NDCG=.62,去时效特征=.58,该组离线增益.04;仍需在线验证。;边界:只报训练loss;在测试集反复选特征。。