第10章笔记:预训练语言模型与大模型
课程笔记学习预训练目标、Tokenizer、数据、微调、提示、对齐和推理效率。
关联:章节 第10章 预训练语言模型与大模型
第10章笔记:预训练语言模型与大模型
本章任务
学习预训练目标、Tokenizer、数据、微调、提示、对齐和推理效率。 先用一条能人工判断的短文本、标签序列、语法树或检索集合建立基准,再让代码输出完整中间证据,最后在真实语料、困难语言切片和生产约束下验收。
七节连接
- 预训练目标与表示学习:预训练以掩码、因果、去噪或对比目标从大语料学习可迁移表示;训练目标不等于下游能力证明。 核心关系:pretraining loss averages token/sequence objectives over declared corpus。 算例:因果模型预测下一个token,不能直接看到未来;掩码模型在非掩码位置可利用两侧。 边界:用测试集文本预训练后称零样本;把低loss当事实知识可靠。
- Tokenizer与模型接口:LLM接收token而非字符/词;词表、规范化、特殊token、chat模板和offset映射共同定义真实输入。 核心关系:context usage=input tokens+output budget+special/template tokens。 算例:窗口4096,模板/输入3500,若预留输出400,只剩196余量。 边界:按字符估窗口;训练与推理chat模板不同。
- 预训练数据、去重与记忆:大模型数据需来源、许可、质量、语言比例、文档/基准去重和删除;记忆风险与重复频次相关但非简单等价。 核心关系:effective unique data=raw data-duplicates-contamination under declared hash rules。 算例:100万文档去重12万、基准污染1万,若不重叠则有效87万。 边界:只按URL去重;看到模型答对就假定推理而非记忆。
- 微调、参数高效适配与遗忘:全量微调、adapter/LoRA等改变可训练参数与容量;学习率、数据混合和回放影响遗忘与域适配。 核心关系:LoRA update DeltaW=A B with rank r much smaller than full dimensions。 算例:1000×1000权重全量100万参数,rank8两矩阵约16000参数。 边界:只看新任务提升;adapter与基座版本不匹配仍加载。
- 提示、上下文学习与结构化输出:提示定义任务、证据、约束和输出schema;few-shot示例会引入顺序/标签偏差,结构化输出仍需外部验证。 核心关系:valid output=schema parse∧semantic constraints∧evidence policy。 算例:JSON语法正确但金额字段为负且业务不允许,结构化门禁仍失败。 边界:把系统提示当安全边界;解析成功就直接执行外部动作。
- 指令对齐、偏好与奖励模型:SFT和偏好优化塑造回答行为,偏好数据和奖励模型会带入标注者分布、长度偏好与可钻漏洞。 核心关系:preference objective compares chosen vs rejected under reference/regularization。 算例:若标注者总偏好更长答案,模型可能学会冗长而非更正确。 边界:用模型自评生成偏好再证明自己;安全拒绝和不会回答混为一类。
- 推理效率、量化与上下文成本:推理成本由参数、KV cache、token数、batch、精度和硬件决定;量化/蒸馏需同时验质量和端到端资源。 核心关系:KV cache grows roughly with layers×sequence length×hidden/key dimensions。 算例:序列长度翻倍,在其他固定时KV cache约翻倍,prefill注意力成本可更快增长。 边界:只报每秒token不含排队;量化只测平均任务不测稀有语言。
实验要求
运行本章两道Python语言算法实验的四组测试,并新增空文本、Unicode边界、未知词、非法标签、句法歧义、否定、长上下文、低资源语言、域外、证据冲突或提示注入中的至少一种。保存原文hash/offset、Tokenizer、数据与模型版本、随机种子、中间格表/结构/概率、输出、证据和首个偏差。
错题闭环
按字符/token/offset、规范化、概率分母、动态规划状态、标签约束、句法结构、语义作用域、训练测试泄漏、检索召回、引用蕴含、校准、隐私和工具授权分类。更换一个词频、上下文、标签、阈值、候选数、语言或证据版本重做阶段卷;能先预测变化方向,再复算并解释失效,才算掌握。