跳到正文

第10章笔记:语义、实例与全景分割

课程笔记

处理像素损失、编码器—解码器、实例、全景、弱监督和边界部署。

关联:章节 第10章 语义、实例与全景分割

第10章笔记:语义、实例与全景分割

本章任务

处理像素损失、编码器—解码器、实例、全景、弱监督和边界部署。 先用一幅小图、少量点、短视频或手算张量建立基准,再让代码输出全部中间证据,最后在真实分辨率、困难切片和系统资源约束下验收。

七节连接

  • 语义分割与像素分类:语义分割为每个像素分配类别但不区分同类实例;标签边界、ignore区域和下采样对齐重要。 核心关系:pixel accuracy=correct labeled pixels/all evaluated pixels。 算例:1000评估像素中900正确,像素准确率90%。 边界:背景占多数使像素准确率虚高;resize标签使用双线性产生非法类。
  • 交叉熵、Dice与类别重叠:像素交叉熵逐点分类,Dice/IoU直接关心区域重叠;平滑项和空类别处理需声明。 核心关系:Dice=2TP/(2TP+FP+FN)。 算例:TP=40、FP=10、FN=20,Dice=80/110≈.7273。 边界:空真值/空预测除零;只优化Dice导致概率校准差未检查。
  • 编码器—解码器与跳跃连接:编码器压缩语义,解码器恢复分辨率,跳跃连接补细节;上采样对齐影响边界。 核心关系:output stride=input resolution/feature resolution。 算例:输入512、特征32,output stride=16。 边界:随意crop对齐掩盖一像素偏移;高分辨特征耗显存失控。
  • 实例分割与掩码质量:实例分割同时检测对象并为每个实例预测mask;框、类别和mask错误会相互传播。 核心关系:mask AP uses ranked instance predictions over IoU thresholds。 算例:两个相邻同类物体语义mask连在一起,实例方法需分成两个ID。 边界:用框IoU代替mask IoU;resize回原图发生错位。
  • 全景分割与一致性:全景分割统一可数thing实例和不可数stuff区域,每像素只能有一个类别/实例归属。 核心关系:panoptic quality≈segmentation quality×recognition quality。 算例:SQ=.8、RQ=.75,PQ=.6。 边界:多个mask重叠按分数覆盖导致stuff孔洞;同实例ID跨图复用。
  • 弱监督、半监督与伪标签:昂贵像素标注可由图像级、框、点或无标签数据辅助;伪标签阈值和确认偏差必须评估。 核心关系:effective pseudo-label count=accepted count×estimated precision。 算例:接受1000伪标签、估计精度.9,约900个有效正确标签。 边界:用模型自己的高置信输出证明自己;稀有类伪标签几乎没有。
  • 边界、细目标与分割部署:边界质量受标注模糊、下采样、后处理和输入尺寸影响;部署需计预处理、切片与拼接。 核心关系:boundary error can be measured within tolerance band。 算例:容许2px边界带时命中率高,不代表精确轮廓;需报告容差。 边界:只看整体IoU;瓦片重叠处出现接缝却未计。

实验要求

运行本章两道Python视觉算法实验的四组测试,并新增空输入、零深度、退化匹配、遮挡、模糊、低纹理、域外、类别长尾、错标定或资源超限中的至少一种。保存原图/样本hash、相机与坐标、数据和模型版本、随机种子、中间量、预测、残差、指标和首个偏差。

错题闭环

按成像假设、坐标/单位、shape、采样、几何退化、阈值方向、训练测试泄漏、指标分母、置信校准、最差切片、隐私与部署资源分类。更换一个焦距、基线、噪声、阈值、划分单位、设备或失败条件重做阶段卷;能先预测变化方向,再复算并解释失效,才算真正掌握。