计算机视觉总笔记
课程笔记用成像—几何—学习—评价—部署证据链贯穿全课。
关联:全课程
计算机视觉总笔记
从世界到决策的一条主线
计算机视觉从来不只是“图像输入、标签输出”。真实世界的光经过物体反射、镜头、曝光和传感器,变成有限采样与量化的像素;算法再依靠相机模型、空间/时间连续性、数据分布和任务先验,估计几何、类别、位置、关系或动作。每个结论都只在明确假设内成立:单幅图像会丢失深度,遮挡会丢失观测,光照会混淆反射率,数据集会带入采集偏差。
固定解题顺序
先写用户任务和错误代价,再写场景、相机、坐标、单位、时间与数据划分;画出输入到输出的中间对象;写公式的假设并手算一个可检查小例;实现时输出中间张量、匹配、残差、概率或损失;最后用遮挡、低纹理、错标定、域外、长尾和设备变化做最短失败反例。只给模型名、彩色热图或一个总体准确率都不合格。
几何与学习如何连接
针孔投影和标定把像素射线接到三维世界;局部特征、极线、三角化、PnP与束调整通过重投影闭环检验几何。卷积和尺度空间从局部结构获得表示,传统分类器或深度网络把表示映射为预测。检测和分割增加空间定位,视频增加时间关联,点云和SLAM增加三维地图,视觉语言模型增加文本条件。学习模型可以补足难以显式建模的先验,但不能取消坐标、成像和数据边界。
实验与评价纪律
训练、验证、测试按主体、视频、地点或时间隔离,先用hash去重;保存相机/设备、预处理、数据版本、随机种子、权重、环境和评测脚本。几何实验报告逐点残差与退化,学习实验报告逐类、尺寸、遮挡、设备和最差群体,部署实验报告端到端p50/p95、吞吐、显存、能耗与拒识覆盖。任何指标都要注明分母、阈值、IoU条件和数据版本。
可信部署边界
softmax最大值不是事实概率,显著图不是因果证明,生成结果逼真不等于真实,embedding也不天然匿名。高风险视觉必须有校准、域外检测、选择性拒绝、人工接管、隐私删除、审计、灰度与回滚。线上错例不能未经审核自动回灌;模型更新必须能重现旧版本、解释差异并在关键困难切片逐项过门禁。
反查模板
从业务动作向后查阈值与拒识、预测、模型/参数、特征或几何残差、预处理、原图hash、相机与场景;从光线和采样向前重放。找到第一个违反的坐标、假设、版本或数据边界,修复后把该失败样本加入独立回归集,而不是删除它来提高分数。