低秩近似:图片压缩与推荐的秘密
约 10 分钟
SVD 的超级应用来了
上节说奇异值有大有小。大胆的想法:小的奇异值贡献小,把小的全扔掉,机器还能凑合用吗?不但能,还特别好用——这就是低秩近似。
图片压缩:扔掉大半还认得
一张 1000×1000 的灰度图就是一个矩阵。它的奇异值往往前几十个就占了绝大部分能量:只保留前 50 个,存储量降到原来的一成上下,肉眼几乎看不出差别。主流图像压缩的背后都是这类思想。
推荐系统:猜你没看过的电影
用户—电影评分表是个巨大且很多空格的矩阵。用矩阵分解把每个用户、每部电影各压成几十维的向量:你和某部电影的向量方向越合,它越可能被推荐给你。当年 Netflix 百万美元大奖赛的冠军方案,核心就是矩阵分解。
为什么扔得掉
因为真实数据「秩很低」:成绩表几十列,背后可能就「文科脑」「理科脑」两三个潜因素。冗余是常态,压缩是红利——呼应本章第一讲的秩。
常见误区:扔小奇异值不是「丢精度」
很多时候是去噪——噪声恰恰爱藏在小奇异值里。
练一练:和家长把同一张照片分别「发原图」和「压缩发送」,找找压缩痕迹先出现在哪里。
小纸条
拍一张书架照片,眯起眼睛看它——细节消失、轮廓还在,这就是一次人肉低秩近似。
登录 后可看答案