跳到正文

第11章笔记:深度、点云、神经场与SLAM

课程笔记

连接单目/RGB-D深度、点云、ICP、表面、神经场和定位建图。

关联:章节 第11章 深度、点云、神经场与SLAM

第11章笔记:深度、点云、神经场与SLAM

本章任务

连接单目/RGB-D深度、点云、ICP、表面、神经场和定位建图。 先用一幅小图、少量点、短视频或手算张量建立基准,再让代码输出全部中间证据,最后在真实分辨率、困难切片和系统资源约束下验收。

七节连接

  • 单目深度与尺度歧义:单目可从学习先验估相对深度,但绝对尺度受相机、场景和训练分布影响。 核心关系:scale-aligned error minimizes over a global scale factor。 算例:预测深度全是真值一半,形状正确但绝对尺度差2倍。 边界:把相对深度直接当米;训练室内模型用于道路。
  • RGB-D、深度反投影与缺失值:深度像素结合K反投影为三维点;深度单位、无效值、RGB配准和时间同步必须一致。 核心关系:X=(u-cx)Z/fx,Y=(v-cy)Z/fy。 算例:u-cx=100、Z=2m、fx=500,X=.4m。 边界:0深度当真实零距离;彩色与深度时间错位。
  • 点云邻域、法向与采样:点云无固定网格,邻域尺度决定法向、曲率和去噪;密度变化会偏置学习与几何。 核心关系:normal is eigenvector of local covariance with smallest eigenvalue。 算例:平面邻域最小方差方向垂直平面,作为法向候选。 边界:k过大跨表面;法向符号未统一导致相邻翻转。
  • ICP配准与最近点迭代:ICP交替建立对应并求刚体变换,依赖初值、重叠、对应拒绝和局部最优。 核心关系:min_R,t Σ||q_i-(R p_i+t)||²。 算例:一维点集[0,1]到[2,3]的纯平移为+2。 边界:无重叠仍强配准;只看目标下降不检查错误对齐。
  • 体素、网格与表面重建:体素适合占据/TSDF融合,网格表达表面拓扑;分辨率提高会立方增加存储。 核心关系:voxel count≈(side/resolution)^3。 算例:边长1m、分辨率.1m,每轴10格,共1000体素。 边界:全空间高分辨稠密体素爆内存;错误姿态把表面抹厚。
  • 神经场与新视角合成:神经辐射场沿射线积分密度和颜色,需要已知/优化相机姿态与充分视角覆盖。 核心关系:rendered color=Σ transmittance_i×alpha_i×color_i。 算例:两采样权重.7和.3、颜色0.2和0.8,合成0.38。 边界:训练视角重建好就称三维准确;反光/动态场景违背假设。
  • 视觉SLAM与定位建图闭环:SLAM联合估计轨迹与地图,前端跟踪、后端优化、回环和重定位共同控制漂移。 核心关系:pose graph objective sums relative-pose residuals over edges。 算例:100m轨迹终点偏2m,终点漂移率2%,回环应分配误差而非瞬移。 边界:只报局部重投影;错误回环造成全图折叠。

实验要求

运行本章两道Python视觉算法实验的四组测试,并新增空输入、零深度、退化匹配、遮挡、模糊、低纹理、域外、类别长尾、错标定或资源超限中的至少一种。保存原图/样本hash、相机与坐标、数据和模型版本、随机种子、中间量、预测、残差、指标和首个偏差。

错题闭环

按成像假设、坐标/单位、shape、采样、几何退化、阈值方向、训练测试泄漏、指标分母、置信校准、最差切片、隐私与部署资源分类。更换一个焦距、基线、噪声、阈值、划分单位、设备或失败条件重做阶段卷;能先预测变化方向,再复算并解释失效,才算真正掌握。