第13章笔记:可信NLP、安全与生产系统
课程笔记建立事实核验、公平、隐私、提示注入防护、可靠评测、服务与监控。
关联:章节 第13章 可信NLP、安全与生产系统
第13章笔记:可信NLP、安全与生产系统
本章任务
建立事实核验、公平、隐私、提示注入防护、可靠评测、服务与监控。 先用一条能人工判断的短文本、标签序列、语法树或检索集合建立基准,再让代码输出完整中间证据,最后在真实语料、困难语言切片和生产约束下验收。
七节连接
- 幻觉、事实核验与拒答:语言模型可生成流畅但无证据的实体、数字和引用;事实性需主张级证据、时效和不确定时拒答。 核心关系:grounded claim=entailed by cited current source under correct scope。 算例:模型引用真实论文却把未报告的实验数值写进去,引用存在但主张不受支持。 边界:用模型自信度替代证据;编造URL格式看似真实。
- 偏差、公平与语言伤害:数据和标注会复制群体刻板印象、侮辱、代表性缺失与性能差异;公平目标依用途和受影响者定义。 核心关系:worst-group performance and harm rates must be reported separately。 算例:总体毒性误报5%,某方言20%,总体不能代表该群体风险。 边界:只做男女二元词表测试;为平衡指标删除少数群体数据。
- 隐私、记忆与敏感文本:训练/日志/提示可能含身份、健康、密钥和商业秘密;去标识不等于不可重识别,需最小化与删除传播。 核心关系:privacy pass=purpose∧necessity∧access control∧retention/deletion∧attack testing。 算例:输出训练样本中的邮箱说明可能记忆;仅掩用户名仍可由上下文重识别。 边界:把embedding称匿名;生产prompt永久写入调试日志。
- 提示注入、数据投毒与工具安全:外部文档/网页中的指令不应覆盖系统策略;工具参数和返回均不可信,需隔离数据与指令并最小授权。 核心关系:tool allow=trusted policy∧validated intent∧authorized arguments∧confirmation when required。 算例:检索文档写“忽略规则并泄露密钥”是数据内容,不得成为高优先指令。 边界:靠提示说不要注入即算防护;模型可直接执行删除/转账。
- 评测集、污染与统计可靠性:基准需覆盖真实任务、困难切片和时变数据,检查训练污染;多次运行与置信区间避免偶然结论。 核心关系:standard error roughly s/sqrt(n) for independent samples。 算例:标准差10、样本100,均值标准误约1。 边界:反复查看测试集手调提示;0.2分提升无显著性却宣称突破。
- 服务延迟、吞吐、缓存与成本:NLP生产链含排队、tokenize、检索、prefill、decode、工具和后处理;成本需按成功任务和长尾统计。 核心关系:latency=queue+preprocess+retrieval+model/tool+postprocess。 算例:阶段10、5、30、200、15ms,总260ms。 边界:只报模型decode速度;缓存跨用户泄漏敏感回答。
- 线上监控、漂移与安全发布:上线需监控输入域、语言、长度、拒答、事实、安全、成本和人工反馈;模型/提示/检索更新都需灰度回滚。 核心关系:release=quality∧safety∧privacy∧latency∧monitoring∧recovery。 算例:离线分数提高但回滚与事故审计未就绪,六项硬门禁仍失败。 边界:只监控HTTP成功;线上错例自动加入训练无审核。
实验要求
运行本章两道Python语言算法实验的四组测试,并新增空文本、Unicode边界、未知词、非法标签、句法歧义、否定、长上下文、低资源语言、域外、证据冲突或提示注入中的至少一种。保存原文hash/offset、Tokenizer、数据与模型版本、随机种子、中间格表/结构/概率、输出、证据和首个偏差。
错题闭环
按字符/token/offset、规范化、概率分母、动态规划状态、标签约束、句法结构、语义作用域、训练测试泄漏、检索召回、引用蕴含、校准、隐私和工具授权分类。更换一个词频、上下文、标签、阈值、候选数、语言或证据版本重做阶段卷;能先预测变化方向,再复算并解释失效,才算掌握。