闭卷重建朴素贝叶斯文本分类的对象、公式、算例、算法与失败边界。
自然语言处理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建逻辑回归与稀疏文本特征的对象、公式、算例、算法与失败边界。
闭卷重建TF-IDF、特征选择与泄漏的对象、公式、算例、算法与失败边界。
闭卷重建主题模型与LDA的对象、公式、算例、算法与失败边界。
闭卷重建关系抽取与实体对的对象、公式、算例、算法与失败边界。
闭卷重建事件抽取与论元结构的对象、公式、算例、算法与失败边界。
闭卷重建不平衡、校准与业务阈值的对象、公式、算例、算法与失败边界。
对象:逻辑回归对TF-IDF或其他特征做线性判别并输出sigmoid概率;正则控制高维过拟合。;公式:P(y=1|x)=1/(1+exp(-(w·x+b)))。;算例:logit=0时概率.5。;边界:未标准化连续特征支配文本特征;在测试集选择阈值。。
对象:多项式NB用类别先验和条件词概率累加对数分数,条件独立虽不真实但可形成强基线。;公式:score(c)=log P(c)+Σ count(w)log P(w|c)。;算例:先验对数-.7,两个词贡献-.3和-.5,总分-1.5。;边界:用测试文档更新词概率;未登录词概率为零。。
对象:LDA假设文档混合主题、主题生成词,用潜变量解释共现;主题数和可解释性不等于真实本体。;公式:P(word|document)=Σ_topic P(word|topic)P(topic|document)。;算例:文档主题权重.7/.3,词在两主题概率.2/.6,总概率.32。;边界:人工给主题命名后当因果类别;用困惑度最低宣称最可解释。。
对象:TF-IDF降低全局常见词权重,词表、IDF和特征选择只能在训练数据拟合。;公式:idf=log(N/(df+offset)) under declared smoothing。;算例:N=100、df=10,未平滑自然对数idf=ln10。;边界:全数据算IDF和卡方选择;文档长度处理口径不一致。。
对象:事件包含触发词、类型、论元、角色和时间/地点,跨句共指与多事件重叠使评价复杂。;公式:event exact match requires trigger+type+declared arguments。;算例:“公司昨日收购工厂”触发“收购”,公司/工厂/昨日分别是买方、标的、时间。;边界:只检测触发就称事件完成;同一论元绑定错事件。。
对象:关系抽取在实体对和上下文上预测类型,需处理方向、无关系类、跨句和实体错误传播。;公式:relation instance=(arg1 span,arg2 span,direction,context,label)。;算例:“甲收购乙”中acquire(甲,乙)方向不能反转。;边界:只在含关系句上训练导致无关系失真;实体跨度错仍算关系对。。
对象:文本任务常有稀有正类和代价不对称;采样/权重改变训练分布,部署需校准并按成本选阈值。;公式:expected cost=FP×cost_FP+FN×cost_FN。;算例:FP=10成本1、FN=3成本5,总成本25。;边界:只优化准确率;重采样后直接把概率当真实先验。。