闭卷重建预训练目标与表示学习的对象、公式、算例、算法与失败边界。
自然语言处理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建Tokenizer与模型接口的对象、公式、算例、算法与失败边界。
闭卷重建预训练数据、去重与记忆的对象、公式、算例、算法与失败边界。
闭卷重建微调、参数高效适配与遗忘的对象、公式、算例、算法与失败边界。
闭卷重建提示、上下文学习与结构化输出的对象、公式、算例、算法与失败边界。
闭卷重建指令对齐、偏好与奖励模型的对象、公式、算例、算法与失败边界。
闭卷重建推理效率、量化与上下文成本的对象、公式、算例、算法与失败边界。
对象:LLM接收token而非字符/词;词表、规范化、特殊token、chat模板和offset映射共同定义真实输入。;公式:context usage=input tokens+output budget+special/template tokens。;算例:窗口4096,模板/输入3500,若预留输出400,只剩196余量。;边界:按字符估窗口;训练与推理chat模板不同。。
对象:预训练以掩码、因果、去噪或对比目标从大语料学习可迁移表示;训练目标不等于下游能力证明。;公式:pretraining loss averages token/sequence objectives over declared corpus。;算例:因果模型预测下一个token,不能直接看到未来;掩码模型在非掩码位置可利用两侧。;边界:用测试集文本预训练后称零样本;把低loss当事实知识可靠。。
对象:全量微调、adapter/LoRA等改变可训练参数与容量;学习率、数据混合和回放影响遗忘与域适配。;公式:LoRA update DeltaW=A B with rank r much smaller than full dimensions。;算例:1000×1000权重全量100万参数,rank8两矩阵约16000参数。;边界:只看新任务提升;adapter与基座版本不匹配仍加载。。
对象:大模型数据需来源、许可、质量、语言比例、文档/基准去重和删除;记忆风险与重复频次相关但非简单等价。;公式:effective unique data=raw data-duplicates-contamination under declared hash rules。;算例:100万文档去重12万、基准污染1万,若不重叠则有效87万。;边界:只按URL去重;看到模型答对就假定推理而非记忆。。
对象:SFT和偏好优化塑造回答行为,偏好数据和奖励模型会带入标注者分布、长度偏好与可钻漏洞。;公式:preference objective compares chosen vs rejected under reference/regularization。;算例:若标注者总偏好更长答案,模型可能学会冗长而非更正确。;边界:用模型自评生成偏好再证明自己;安全拒绝和不会回答混为一类。。
对象:提示定义任务、证据、约束和输出schema;few-shot示例会引入顺序/标签偏差,结构化输出仍需外部验证。;公式:valid output=schema parse∧semantic constraints∧evidence policy。;算例:JSON语法正确但金额字段为负且业务不允许,结构化门禁仍失败。;边界:把系统提示当安全边界;解析成功就直接执行外部动作。。
对象:推理成本由参数、KV cache、token数、batch、精度和硬件决定;量化/蒸馏需同时验质量和端到端资源。;公式:KV cache grows roughly with layers×sequence length×hidden/key dimensions。;算例:序列长度翻倍,在其他固定时KV cache约翻倍,prefill注意力成本可更快增长。;边界:只报每秒token不含排队;量化只测平均任务不测稀有语言。。