线性代数

低秩近似:图片压缩与推荐的秘密

10 分钟

SVD 的超级应用来了

上节说奇异值有大有小。大胆的想法:小的奇异值贡献小,把小的全扔掉,机器还能凑合用吗?不但能,还特别好用——这就是低秩近似。

图片压缩:扔掉大半还认得

一张 1000×1000 的灰度图就是一个矩阵。它的奇异值往往前几十个就占了绝大部分能量:只保留前 50 个,存储量降到原来的一成上下,肉眼几乎看不出差别。主流图像压缩的背后都是这类思想。

推荐系统:猜你没看过的电影

用户—电影评分表是个巨大且很多空格的矩阵。用矩阵分解把每个用户、每部电影各压成几十维的向量:你和某部电影的向量方向越合,它越可能被推荐给你。当年 Netflix 百万美元大奖赛的冠军方案,核心就是矩阵分解。

为什么扔得掉

因为真实数据「秩很低」:成绩表几十列,背后可能就「文科脑」「理科脑」两三个潜因素。冗余是常态,压缩是红利——呼应本章第一讲的秩。

常见误区:扔小奇异值不是「丢精度」

很多时候是去噪——噪声恰恰爱藏在小奇异值里。

练一练:和家长把同一张照片分别「发原图」和「压缩发送」,找找压缩痕迹先出现在哪里。

小纸条

拍一张书架照片,眯起眼睛看它——细节消失、轮廓还在,这就是一次人肉低秩近似。

登录 后可看答案