机器学习基础

特征工程与实战流程

10 分钟

什么是特征

特征是喂给模型的「输入变量」。同一件事,描述方式不同,模型学起来天差地别:预测房价,「到地铁站 800 米」是好特征,「门牌号是 42 号」基本是噪声。

特征工程:把原始数据变成好输入

  • 数值化:类别变数字,比如「朝南 / 朝北」变 0 和 1。
  • 归一化:把不同量纲拉到相近范围——面积几十到几百、单价几万,不缩放的话大数值会主导训练。
  • 构造新特征:人的经验在这里发光。预测用电量,「是不是节假日」往往比「日期」本身有用得多——这是人替机器指出的视角。

一个完整项目的流程

  1. 定义问题:回归还是分类?什么叫「好」?
  2. 收集和清洗数据(实际项目里最花时间,常占一半以上)。
  3. 特征工程。
  4. 选模型、训练、用验证集调参。
  5. 测试集最终评估,部署上线,持续监控。

常见误区

迷信「换个大模型就能解决一切」。业界共识:数据和特征决定效果的上限,模型只是逼近这个上限——垃圾进,垃圾出。

结语:通往 d2l 的地图

九讲到此,读 d2l 的地图已经在你手里:预备知识补数学(线代、微积分、概率、自动微分)→ 线性网络对应第三讲的回归 → 多层感知机正式讲过拟合与正则化 → 之后卷积、循环、注意力一路展开。原书用 PyTorch 把每个概念写成能跑的代码,边读边跑,就是这门课最好的续集。

练一练:选一个你关心的问题(比如「明天要不要带伞」),写出你会收集的 5 个特征。

小纸条

为一个自选问题设计 5 个输入特征,并说说哪个可能最有用。

登录 后可看答案