闭卷重建自注意力与视觉Transformer的对象、公式、算例、算法与失败边界。
计算机视觉 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建对比学习与表示空间的对象、公式、算例、算法与失败边界。
闭卷重建视觉—语言对齐与零样本分类的对象、公式、算例、算法与失败边界。
闭卷重建图像描述、VQA与幻觉的对象、公式、算例、算法与失败边界。
闭卷重建生成模型与扩散过程的对象、公式、算例、算法与失败边界。
闭卷重建鲁棒性、域外与对抗扰动的对象、公式、算例、算法与失败边界。
闭卷重建多模态系统的检索、工具与验收的对象、公式、算例、算法与失败边界。
对象:对比学习拉近正样本、推远负样本;正对定义、温度和batch/队列决定学到的不变性。;公式:InfoNCE=-log exp(sim_pos/tau)/Σ exp(sim_j/tau)。;算例:正对相似度高但把同类别其他图全当负样本可能产生假负。;边界:裁剪掉目标仍标正对;测试图参与预训练后称零样本。。
对象:自注意力按内容关系混合token,位置编码提供空间顺序;计算和显存通常随token数平方增长。;公式:attention(Q,K,V)=softmax(QK^T/sqrt(d))V。;算例:token数从100增到200,注意力矩阵元素从1万增到4万,约4倍。;边界:不加位置仍期待空间结构;高分辨率直接全局注意力OOM。。
对象:生成式视觉语言任务需图像证据、语言先验和解码;流畅答案可能描述图中不存在对象。;公式:grounded answer requires evidence localization+semantic correctness。;算例:问题问红灯数量,模型答2却无法定位实例,应判证据不足。;边界:用文本常识覆盖图像;只凭BLEU评事实正确性。。
对象:图像和文本编码到共享空间,以提示文本作为类别原型;结果依赖词义、提示、语言和预训练偏差。;公式:prediction=argmax cosine(image_embedding,text_embedding_class)。;算例:图像与三类文本相似度.2,.7,.4,选择第二类。;边界:提示含测试答案描述造成泄漏;相似度当校准概率。。
对象:自然腐蚀、域迁移和对抗扰动都可能改变预测;威胁模型、扰动预算和感知约束需明确。;公式:robust accuracy=correct under declared perturbation set/total。;算例:100样本中干净90正确,扰动后60正确,声明集合下鲁棒准确60%。;边界:只测一种随机噪声就称鲁棒;攻击使用错误梯度导致虚假安全。。
对象:扩散模型学习逐步去噪或score,把随机噪声变成样本;采样步数、条件和随机种子影响输出。;公式:forward noise x_t=sqrt(alpha_bar)x_0+sqrt(1-alpha_bar)epsilon。;算例:alpha_bar=.64时信号系数.8、噪声系数.6。;边界:把生成逼真当训练数据未记忆;评价只挑最好图。。
对象:生产多模态系统常组合视觉编码、检索、OCR、检测和语言模型;每个工具输出需可追踪与拒绝。;公式:system correctness requires perception∧retrieval/tool∧reasoning∧policy。;算例:视觉识别正确但OCR错一个剂量数字,最终建议仍不合格。;边界:只评最终语言流畅度;工具失败被模型编造补全。。