闭卷重建综合项目任务、用户与验收章程的对象、公式、算例、算法与失败边界。
自然语言处理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建语料、标注与数据版本项目的对象、公式、算例、算法与失败边界。
闭卷重建基线、模型与消融项目实验的对象、公式、算例、算法与失败边界。
闭卷重建结构、检索与生成证据闭环的对象、公式、算例、算法与失败边界。
闭卷重建鲁棒、公平、隐私与攻击评审的对象、公式、算例、算法与失败边界。
闭卷重建部署、监控与可重复发布的对象、公式、算例、算法与失败边界。
闭卷重建现场答辩、故障回放与局限的对象、公式、算例、算法与失败边界。
对象:项目建立许可、来源、去重、主体/时间划分、标注指南、仲裁和删除传播,保留原文偏移。;公式:data ready=licensed∧split-safe∧annotated∧audited∧versioned。;算例:同用户对话跨训练测试造成说话风格泄漏,应按用户/会话隔离。;边界:用全数据学词表/IDF后再切分;修标直接覆盖无审计。。
对象:项目先固定用户语言任务、输入来源、输出用途、错误代价、证据、隐私和人工接管,再选模型。;公式:pass=task quality∧grounding∧robustness∧privacy∧reproducibility。;算例:总体准确达标但关键数字事实性失败,五项硬门禁整体不通过。;边界:先接大模型再找问题;把流畅demo当用户任务成功。。
对象:项目必须输出token/span、标签/树/实体、检索文档、主张引用或工具轨迹,使最终回答可反查。;公式:evidence closure=output linked to every required intermediate artifact。;算例:答案正确但实体偏移和引用文档版本缺失,闭环仍不完整。;边界:只保存prompt和回答;中间检索/工具结果被覆盖。。
对象:从规则、n-gram/线性基线到Transformer/LLM逐层增加复杂度,用同一协议和消融证明贡献。;公式:component gain=metric_full-metric_without_component。;算例:完整F1=.82,去检索=.70,检索贡献.12。;边界:同时换数据、模型和提示却归因单组件。。
对象:提交数据/代码/tokenizer/权重/提示/索引digest、环境、基准、模型卡、灰度、监控和回滚。;公式:artifact identity=hash(data,code,tokenizer,weights,prompt,index,toolchain)。;算例:权重相同但chat模板或检索索引变化会改变输出,必须纳入版本身份。;边界:只交模型名与API;线上提示已改却无法复现事故。。
对象:在拼写噪声、域外、长文本、低资源语言、最差群体、PII和提示注入下联合验收并提供拒答。;公式:risk pass requires every critical slice above/below its declared threshold。;算例:总体95%但某低资源语言60%低于80%门槛,不能平均通过。;边界:只做随机字符噪声;高风险无证据仍强答。。
对象:答辩从一个回答向后追到token、结构、检索/证据、模型和业务动作,并现场构造最短失败输入。;公式:evidence completeness=linked artifacts/required artifacts。;算例:15类证据只交14类,完整率93.33%,硬性全交门禁仍失败。;边界:只展示精选成功对话;把局限写成以后换更大模型。。