第7章笔记:传统视觉学习与可靠评价
课程笔记用词袋、线性模型、SVM、校准、聚类和域偏差建立基线。
关联:章节 第7章 传统视觉学习与可靠评价
第7章笔记:传统视觉学习与可靠评价
本章任务
用词袋、线性模型、SVM、校准、聚类和域偏差建立基线。 先用一幅小图、少量点、短视频或手算张量建立基准,再让代码输出全部中间证据,最后在真实分辨率、困难切片和系统资源约束下验收。
七节连接
- 手工特征、词袋与空间金字塔:局部描述子量化为视觉词并统计,空间金字塔保留粗布局;量化误差与词表数据决定泛化。 核心关系:histogram_j=count(assign(descriptor)=j),then normalize。 算例:8个描述子分到4词的计数[2,1,3,2],L1归一为[.25,.125,.375,.25]。 边界:用全数据聚类造成泄漏;不同图像描述子数未归一化。
- 线性分类器与决策边界:线性模型用w^T x+b划分特征空间;标准化、正则和类别权重决定边界与泛化。 核心关系:score=w^T x+b。 算例:w=(2,-1)、x=(3,4)、b=.5,score=2.5。 边界:在测试集调C;特征尺度差异使权重解释失真。
- SVM间隔与核方法:SVM最大化几何间隔并惩罚违例;核隐式比较高维特征但计算随样本增长。 核心关系:hinge loss=max(0,1-y score)。 算例:y=1、score=.3,hinge loss=.7。 边界:把训练准确率最高当最佳C;RBF尺度未配合特征标准化。
- 概率校准与拒识:分类分数排序好不等于概率可信;校准映射置信度到经验正确率,并为高风险任务设置拒识。 核心关系:ECE≈Σ bin_weight×|accuracy-confidence|。 算例:一个占50%样本的bin准确.7、置信.9,对ECE贡献.1。 边界:用训练集校准;只降ECE却破坏类别排序未检查。
- 聚类、k-means与无监督评价:k-means交替分配到最近中心并更新均值,只最小化欧氏平方误差且对初始化/尺度敏感。 核心关系:objective=Σ||x_i-mu_assignment||²。 算例:一维点1、3分同簇,中心为2,平方误差1+1=2。 边界:按标签选择最好聚类后称无监督;不同量纲未标准化。
- 分类评价、ROC与不平衡:阈值改变TPR/FPR与精确率召回率;类极不平衡时PR曲线常比准确率更有解释力。 核心关系:TPR=TP/P,FPR=FP/N。 算例:P=100中TP=80,N=900中FP=90,TPR=.8、FPR=.1。 边界:只报AUC不指定阈值;负类太多时99%准确率无用。
- 数据偏差、快捷特征与域迁移:模型可能依赖背景、水印、相机或采集流程而非目标因果特征;跨域切片和反事实能暴露快捷方式。 核心关系:deployment risk depends on divergence between train and target conditions。 算例:训练牛图都在草地、骆驼都在沙地,换背景后分类崩溃说明学到环境捷径。 边界:随机按图片划分让同场景近重复跨集;只增数据不改偏差。
实验要求
运行本章两道Python视觉算法实验的四组测试,并新增空输入、零深度、退化匹配、遮挡、模糊、低纹理、域外、类别长尾、错标定或资源超限中的至少一种。保存原图/样本hash、相机与坐标、数据和模型版本、随机种子、中间量、预测、残差、指标和首个偏差。
错题闭环
按成像假设、坐标/单位、shape、采样、几何退化、阈值方向、训练测试泄漏、指标分母、置信校准、最差切片、隐私与部署资源分类。更换一个焦距、基线、噪声、阈值、划分单位、设备或失败条件重做阶段卷;能先预测变化方向,再复算并解释失效,才算真正掌握。