机器学习基础

无监督学习:没有答案呢

10 分钟

没有标签,机器还能学什么

没有标准答案,机器就自己找结构。最常见的两种:

  • 聚类:把相似的数据自动分组。给音乐软件 100 万首歌的音频特征,不带任何标签,它能聚出「古典」「摇滚」「电子」这样的簇——没人告诉它这些名字,但组与组之间的界线是它自己画的。
  • 降维:把高维数据压成低维、保留主要信息。一张 1000×1000 的照片有百万个像素,真正重要的变化也许几十个数字就能概括——就像用「身高、体重、年龄」三个数粗略描述一个人。

生活类比

把一箱混装的乐高倒在地上,你自然会按颜色和形状分成几堆——没人给你「标准分法」,但「相似的放一起」本身就是一种学习。聚类干的就是这件事。

还有一种常见用法

异常检测也算广义的无监督:先学「正常长什么样」,跟正常差太远的就报警——银行用它抓可疑交易,工厂用它发现设备的异常振动。

常见误区

无监督不是「更高级、不需要人」。聚成几组、什么叫「相似」,都得人来定;分出来的组是什么意思,也要人去解读。它只是省了标注,不省思考。

练一练:假如把全班同学「聚类」,你会选哪些特征(身高?爱好?成绩?),可能分成哪几组?

小纸条

说说聚类和降维各解决什么问题,举一个生活例子。

登录 后可看答案