深度学习入门

数据增强:一份数据吃出十份效果

10 分钟

猫照片不够,怎么办

训练一个猫分类器,你只有 500 张照片,远远不够第一章说的「成千上万」的规模。重新拍 5000 张?成本太高。数据增强的思路是:对已有照片做不改变含义的小改动,一张照片变十张

图像里的常用招式

把照片水平翻转——猫还是猫;轻微旋转 10 度、放大缩小、裁剪掉一个角、调亮调暗一点——猫依然是猫。这些改动对人是「同一张照片」,对网络却是全新的训练样本,逼着它学会「不管角度亮度怎么变,抓住猫的本质」。数据量仿佛凭空翻了十倍,过拟合立刻缓解。这招还能对付「偏科」:如果你的照片全是猫朝左,模型可能误以为「朝左」是猫的特征,翻转一半照片就把这个偏见消掉了。

不止图片

语音可以加一点背景噪音、稍微变速变调——唤醒词识别器就是这样在嘈杂环境里练出来的。文本也能增强:同义词替换、句子顺序微调。但有一条铁律:改动不能改变标签——把「6」旋转 180 度变成「9」,标签还是 6,那就是亲手教模型犯错。

常见误区

增强不是越多越好:改动太狠(把猫裁得只剩一个耳朵),训练样本变成噪音;也别指望增强代替真实数据,它只是放大已有数据的多样性。

练一练:拿一张自己的照片,列出 3 种「改动后你还是你」的处理和 1 种「改动后不像你了」的处理。

小纸条

拿一张照片,列出三种改完还是本人的增强方式,和一种改完就不算本人的过度改动。

登录 后可看答案