跳到正文

视觉模型实验:从卷积归纳偏置到迁移

14 分钟

CNN利用局部连接、权重共享和平移相关等归纳偏置,适合图像,但数据增强、分辨率和预训练会显著影响结果。比较架构时必须控制训练配方,否则分数差不只来自模型。

数据布局

确认通道顺序、像素范围、颜色空间和归一化统计。预训练模型通常要求特定输入处理;错误均值方差可能让迁移性能骤降却不报错。

增强边界

翻转、裁剪、颜色扰动应保持标签语义。文字、医学左右和方向性目标可能不允许翻转。增强只作用训练集,验证保持确定。

迁移学习

先冻结骨干训练新头,验证标签与管线;再以较低学习率解冻部分或全部层。预训练域差异大时不必总优于从头训练,要保留基线。

类别不平衡

准确率会被多数类主导。报告每类召回、宏F1与混淆矩阵;加权损失、采样和阈值会改变目标,应在验证集选择并锁定。

可视化不是证明

显著图或注意热图可帮助发现模型看背景,但不自动解释因果。用遮挡、反事实背景和分组测试进一步验证。

测试时还要锁定图像解码库与插值方式;训练和部署预处理差一处通道或裁剪,就会形成数据漂移。部署样本应进入回归集。

任务:复现一个小型图像分类模型,比较从头与迁移,并做背景反事实和每类错误分析。

小纸条

比较两个视觉模型时为什么必须控制数据增强和训练配方?