第8章笔记:文本分类与信息抽取
课程笔记用朴素贝叶斯、逻辑回归、TF-IDF、主题、关系、事件与校准建立基线。
关联:章节 第8章 文本分类与信息抽取
第8章笔记:文本分类与信息抽取
本章任务
用朴素贝叶斯、逻辑回归、TF-IDF、主题、关系、事件与校准建立基线。 先用一条能人工判断的短文本、标签序列、语法树或检索集合建立基准,再让代码输出完整中间证据,最后在真实语料、困难语言切片和生产约束下验收。
七节连接
- 朴素贝叶斯文本分类:多项式NB用类别先验和条件词概率累加对数分数,条件独立虽不真实但可形成强基线。 核心关系:score(c)=log P(c)+Σ count(w)log P(w|c)。 算例:先验对数-.7,两个词贡献-.3和-.5,总分-1.5。 边界:用测试文档更新词概率;未登录词概率为零。
- 逻辑回归与稀疏文本特征:逻辑回归对TF-IDF或其他特征做线性判别并输出sigmoid概率;正则控制高维过拟合。 核心关系:P(y=1|x)=1/(1+exp(-(w·x+b)))。 算例:logit=0时概率.5。 边界:未标准化连续特征支配文本特征;在测试集选择阈值。
- TF-IDF、特征选择与泄漏:TF-IDF降低全局常见词权重,词表、IDF和特征选择只能在训练数据拟合。 核心关系:idf=log(N/(df+offset)) under declared smoothing。 算例:N=100、df=10,未平滑自然对数idf=ln10。 边界:全数据算IDF和卡方选择;文档长度处理口径不一致。
- 主题模型与LDA:LDA假设文档混合主题、主题生成词,用潜变量解释共现;主题数和可解释性不等于真实本体。 核心关系:P(word|document)=Σ_topic P(word|topic)P(topic|document)。 算例:文档主题权重.7/.3,词在两主题概率.2/.6,总概率.32。 边界:人工给主题命名后当因果类别;用困惑度最低宣称最可解释。
- 关系抽取与实体对:关系抽取在实体对和上下文上预测类型,需处理方向、无关系类、跨句和实体错误传播。 核心关系:relation instance=(arg1 span,arg2 span,direction,context,label)。 算例:“甲收购乙”中acquire(甲,乙)方向不能反转。 边界:只在含关系句上训练导致无关系失真;实体跨度错仍算关系对。
- 事件抽取与论元结构:事件包含触发词、类型、论元、角色和时间/地点,跨句共指与多事件重叠使评价复杂。 核心关系:event exact match requires trigger+type+declared arguments。 算例:“公司昨日收购工厂”触发“收购”,公司/工厂/昨日分别是买方、标的、时间。 边界:只检测触发就称事件完成;同一论元绑定错事件。
- 不平衡、校准与业务阈值:文本任务常有稀有正类和代价不对称;采样/权重改变训练分布,部署需校准并按成本选阈值。 核心关系:expected cost=FP×cost_FP+FN×cost_FN。 算例:FP=10成本1、FN=3成本5,总成本25。 边界:只优化准确率;重采样后直接把概率当真实先验。
实验要求
运行本章两道Python语言算法实验的四组测试,并新增空文本、Unicode边界、未知词、非法标签、句法歧义、否定、长上下文、低资源语言、域外、证据冲突或提示注入中的至少一种。保存原文hash/offset、Tokenizer、数据与模型版本、随机种子、中间格表/结构/概率、输出、证据和首个偏差。
错题闭环
按字符/token/offset、规范化、概率分母、动态规划状态、标签约束、句法结构、语义作用域、训练测试泄漏、检索召回、引用蕴含、校准、隐私和工具授权分类。更换一个词频、上下文、标签、阈值、候选数、语言或证据版本重做阶段卷;能先预测变化方向,再复算并解释失效,才算掌握。