第8章笔记:深度视觉基础
课程笔记推导卷积、感受野、反向传播、归一化、残差、增强与迁移优化。
关联:章节 第8章 深度视觉基础
第8章笔记:深度视觉基础
本章任务
推导卷积、感受野、反向传播、归一化、残差、增强与迁移优化。 先用一幅小图、少量点、短视频或手算张量建立基准,再让代码输出全部中间证据,最后在真实分辨率、困难切片和系统资源约束下验收。
七节连接
- 卷积层、参数共享与感受野:卷积核在空间共享参数,利用平移结构;步幅、padding和dilation决定输出尺寸与感受野。 核心关系:output=floor((n+2p-d(k-1)-1)/s)+1。 算例:n=32,k=3,p=1,s=1,d=1,输出32。 边界:只看shape不看坐标对齐;偶数核same padding产生偏移。
- 多层感受野与下采样:感受野逐层累计,步幅放大后续跳距;理论感受野不等于实际有效影响范围。 核心关系:r_l=r_prev+(k_l-1)j_prev,j_l=j_prev s_l。 算例:两层3×3、stride1,从r=1得3再5。 边界:把网络深度等同全局上下文;忽略上采样对齐。
- 反向传播与梯度检查:链式法则把损失梯度传到参数;数值梯度可发现实现错误但受步长和浮点影响。 核心关系:dL/dx=(dL/dy)(dy/dx)。 算例:y=x²、L=y,x=3时梯度6。 边界:只因loss下降就认为梯度正确;ReLU拐点做梯度检查。
- 归一化、激活与训练稳定性:激活和归一化改变信号/梯度分布;BatchNorm依赖batch统计,训练与推理行为不同。 核心关系:normalized=(x-mean)/sqrt(variance+epsilon)。 算例:x=7、mean=5、std=2,标准化为1。 边界:忘切eval导致推理漂移;用测试集统计更新模型。
- 残差连接与深层网络:残差块学习F(x)+x,为梯度提供恒等路径;维度不同时需投影或下采样对齐。 核心关系:y=F(x)+x。 算例:x=2、F(x)=-.5,输出1.5。 边界:通道/尺度不一致直接相加;把残差结构当不会过拟合。
- 数据增强与不变性边界:增强编码希望模型不变或等变的变换;标签必须随几何变换同步,不能制造不真实样本。 核心关系:for invariant task f(Tx)=f(x); for equivariant output f(Tx)=T f(x)。 算例:分类水平翻转标签不变,关键点坐标则必须按宽度镜像。 边界:文字识别随意镜像;裁剪后框未截断更新。
- 迁移学习、优化与学习率:预训练特征可减少数据需求,但域差异、冻结策略和学习率影响灾难性遗忘与收敛。 核心关系:parameter update=parameter-learning_rate×gradient。 算例:参数2、梯度.5、学习率.1,更新后1.95。 边界:一开始大步长全量微调;验证集反复人工挑epoch造成过拟合。
实验要求
运行本章两道Python视觉算法实验的四组测试,并新增空输入、零深度、退化匹配、遮挡、模糊、低纹理、域外、类别长尾、错标定或资源超限中的至少一种。保存原图/样本hash、相机与坐标、数据和模型版本、随机种子、中间量、预测、残差、指标和首个偏差。
错题闭环
按成像假设、坐标/单位、shape、采样、几何退化、阈值方向、训练测试泄漏、指标分母、置信校准、最差切片、隐私与部署资源分类。更换一个焦距、基线、噪声、阈值、划分单位、设备或失败条件重做阶段卷;能先预测变化方向,再复算并解释失效,才算真正掌握。