优化、计算性能与 CV/NLP 应用

10 分钟

优化:下山的一百种走法

梯度下降是「蒙眼下山」,但细节讲究很多:

  • 随机梯度下降(SGD):每次只抽一小批数据算方向,像「抽样调查」代替「全民普查」——快得多,还带点颠簸,反而容易跳出小坑
  • 学习率:步长。太大冲过山谷来回震荡,太小走不动。实战里常常「先大后小」,叫学习率衰减
  • Adam:给每个参数单独调步长的「自适应」算法,今天训练网络的默认首选

计算性能:为什么离不开 GPU

神经网络的计算本质是海量矩阵乘法——几千件互不相关的「小活」。CPU 是几位资深专家,GPU 是上万名小学生同时做口算,这种活正是小学生的天下。所以同样一个模型,GPU 能比 CPU 快几十倍。书里还讲了混合精度、多 GPU 并行这些工程手段——知道它们存在即可,用到再回头精读。

应用两章:计算机视觉与 NLP

  • CV 章:目标检测(框出猫在哪)、图像增广(把训练图翻转、裁剪,凭空多出几倍数据)、微调(拿别人训练好的大模型改最后一层,小数据也能出好效果)
  • NLP 章:word2vec 把词变成向量(「国王 − 男人 + 女人 ≈ 女王」),BERT 的「预训练 + 微调」范式——先读遍全网文本,再为具体任务补课

常见误区

「调参是玄学」。其实有章法:先让模型在小数据上能过拟合,再逐步加大数据和正则。书里每章的实验就是这么演示的。

练一练:用手机拍 20 张自家物品照片,给每张翻转一次——数据量翻倍,体会「图像增广」。

小纸条

数一张照片的像素数(比如 1200 万),乘以一个中型网络的参数数,感受为什么需要 GPU。

登录 后可看答案