跳转到内容

3D 与空间感知

多视角 3D 检测、BEV 表征与几何感知方法。

类型 Topics · 更新 2026-07-20

本 Topic 聚焦自动驾驶中的 3D 与空间感知核心问题:如何从多相机图像(及可选雷达)可靠估计深度、构建鸟瞰图(BEV)表征、预测三维占用栅格(occupancy)并支持场景重建,以克服透视畸变、遮挡、尺度模糊与动态物体干扰,为下游检测、跟踪与规划提供稠密几何与语义空间先验。重点覆盖自监督多视图深度、BEV 视图变换、前向-后向占用预测及统一感知-预测框架,依托 nuScenes 与 Occ3D 等基准,解决多相机标定误差、深度不可靠、BEV 对齐与占用稀疏标注等瓶颈,推动从稀疏 3D 框到稠密体素级空间理解的转变。

  • 纯 LiDAR 点云处理与建图细节
  • 端到端规划控制与行为决策
  • 2D 图像分类/检测基础算法
  • 具体传感器硬件标定流程实现
  • foundations — 需掌握相机模型、多视图几何、基本深度估计与 2D/3D 检测范式,才能理解视图变换与 BEV 投影
  • ad-perception-tracking — 空间感知输出常直接支撑 3D 检测跟踪,需了解 BEV 表征在多目标跟踪中的衔接
  • multimodal-perception — 雷达-相机融合与跨模态 BEV 对齐是本 Topic 扩展方向
术语 含义 常见混淆
BEV (Bird’s-Eye-View) 鸟瞰图表征,将多相机透视图像特征投影到俯视平面统一空间,便于几何对齐与下游任务 易与图像平面特征混淆;BEV 是正交投影后的中间表征而非原始输入
Occupancy Prediction 三维占用预测,对体素或网格预测是否被占据及语义类别,提供稠密场景理解 与稀疏 3D 目标检测不同,occupancy 强调全场景填充而非仅实例框
Depth Estimation 深度估计,从单目/多目图像推断像素或特征对应的距离,支撑视图变换 自监督深度依赖光度一致性,动态物体与光照变化易导致误差,非绝对尺度总可靠
View Transformation 视图变换,将图像特征通过深度或注意力机制 lift 到 3D/BEV 空间 LSS 类显式深度 vs Transformer 隐式查询,前者依赖深度质量,后者计算开销不同
Surround Multi-Camera 环视多相机设置,覆盖车辆周围 360 度,用于无缝空间感知 相机间重叠有限、外参误差会放大拼接与对齐伪影
Self-Supervised Multi-View Depth 自监督多视图深度估计,利用相邻相机或时序光度重投影损失训练,无需稠密真值 与有监督深度不同,易受动态场景与遮挡影响,需运动感知或引导注意力增强
Forward-Backward View Transformation 前向-后向视图变换,在占用预测中结合双向投影提升特征一致性与精度 不同于单向 lift,双向可缓解遮挡但增加计算

早期空间感知依赖单目深度或稀疏 3D 检测框,视角受限且几何不一致。随后 BEV 范式兴起,通过显式深度 lift 或时空 Transformer 将多相机统一到鸟瞰表征,实现检测与分割对齐。进一步演进到稠密 occupancy 预测与自监督环视深度,引入前向-后向变换与运动感知,从稀疏实例转向全场景体素理解,并探索统一感知-预测多任务框架。

  1. BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View(精读)— 奠定多相机 BEV 检测模块化范式,视图解耦增强与 Scale-NMS 提升效率精度权衡,统一检测与语义分割路径
  2. BEVFormer: Learning Bird’s-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers(精读)— 核心时空 Transformer 方法,通过 deformable attention 高效学习 BEV 表征,支撑多相机空间感知
  3. SurroundDepth: Entangling Surrounding Views for Self-Supervised Multi-Camera Depth Estimation(中文笔记)— 环视多相机自监督深度基础,纠缠周围视图提升一致性,覆盖 depth estimation 关键关键词
  1. 先读 BEVDet 与 BEVFormer 掌握 BEV 视图变换与多相机检测基础范式
  2. 再读 SurroundDepth 与 BEVDepth/BEVStereo 理解自监督深度与可靠深度获取对 BEV 的影响
  3. 随后 SurroundOcc、FB-OCC 与 Occ3D 进入 occupancy 预测与基准
  4. 扩展 BEVerse 统一感知预测及雷达融合如 RCBEVDet,对比前向后向与运动感知方法
  5. 最后结合 MIC-BEV 等基础设施侧变体思考部署差异
Paper 输入 输出 表示 训练目标
BEVDet 多相机图像 BEV 3D 目标检测框 BEV 特征 + 模块化检测头 高精度高效率多相机 3D 检测,统一分割
BEVFormer 多相机图像序列 BEV 表征支撑检测等 时空 Transformer + deformable attention 学习强 BEV 表征,时空融合
SurroundDepth 环视多相机图像 多视图深度图 纠缠周围视图特征 自监督多相机深度估计
SurroundOcc 多相机图像 3D occupancy 栅格 多相机到 3D 占用 自动驾驶 3D 占用预测
FB-OCC 多视图图像 3D occupancy 前向-后向视图变换 提升占用预测精度与一致性
BEVDepth 多视图图像 3D 检测 可靠深度增强 BEV 获取可靠深度改善多视图 3D 检测
  • 相机外参/内参标定误差导致 BEV 对齐偏移与深度投影错误
  • 自监督深度在动态物体、低纹理、夜间或恶劣天气下失效
  • 占用预测标注稀疏昂贵,伪标签或蒸馏引入噪声
  • 多相机同步与时间戳偏差影响时空融合
  • BEV 分辨率与计算内存权衡,实时性受限
  • 雷达-相机跨模态不对齐与雷达稀疏性处理不当
  • 环视盲区与极端视角遮挡导致占用空洞
  • 如何在无稠密真值下实现鲁棒自监督 occupancy 与长期时序一致性
  • 动态场景运动感知深度与占用联合优化的最优范式
  • 基础设施多相机异构布局下 BEV/occupancy 的可迁移与容错
  • 统一检测-占用-预测多任务共享表征的效率与冲突平衡
  • 视觉中心 3D 重建与实时占用的尺度与绝对精度提升
  • Occ3D 等基准向开放世界与长尾场景扩展
  1. BEV 表征相比图像平面特征在多相机 3D 感知中的主要优势是什么?请结合视图变换说明。
  2. 自监督多相机深度估计(如 SurroundDepth)依赖什么损失?动态物体如何影响训练?
  3. 对比 BEVDet 的模块化检测与 BEVFormer 的 Transformer 方式,各自在时空建模上的取舍?
  4. Occupancy 预测与传统 3D 目标检测的输出差异是什么?为何对规划更有利?
  5. FB-OCC 的前向-后向视图变换如何缓解单向投影问题?结合 SurroundOcc 思考。

本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
watch CenterFusion: Center-based Radar and Camera Fusion for 3D Object Detection 2020 cross-topic assign from registry title match=2 keywords; 202
foundational BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View 2021 BEVDet high-performance multi-camera BEV detection
foundational SurroundDepth: Entangling Surrounding Views for Self-Supervised Multi-Camera Depth Estimation 2022 auto refresh 2026-07-19 sources=arxiv
watch BEVerse: Unified Perception and Prediction in Birds-Eye-View for Vision-Centric Autonomous Driving 2022 coverage fill spatial-perception->watch keyword
watch EGA-Depth: Efficient Guided Attention for Self-Supervised Multi-Camera Depth Estimation 2023 auto refresh 2026-07-19 sources=arxiv,crossref
recent FB-OCC: 3D Occupancy Prediction based on Forward-Backward View Transformation 2023 auto refresh 2026-07-19 sources=arxiv
recent Manydepth2: Motion-Aware Self-Supervised Monocular Depth Estimation in Dynamic Scenes 2023 auto refresh 2026-07-19 sources=arxiv
watch RCBEVDet: Radar-camera Fusion in Bird’s Eye View for 3D Object Detection 2024 cross-topic assign from registry title match=3 keywords; 202
recent 3D Visual Illusion Depth Estimation 2025 auto refresh 2026-07-19 sources=arxiv
watch MIC-BEV: Multi-Infrastructure Camera Bird’s-Eye-View Transformer with Relation-Aware Fusion for 3D Object Detection 2025 cross-topic assign from registry title match=3 keywords; 202
foundational BEVFormer: Learning Bird’s-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers 2022 BEVFormer is a core multi-camera spatial perception method
recent SurroundOcc: Multi-Camera 3D Occupancy Prediction for Autonomous Driving 2023 auto refresh 2026-07-19 sources=openalex
watch Uniocc: a Unified Benchmark for Occupancy Forecasting and Prediction in Autonomous Driving 2025 auto score=43
recent BEVDepth: Acquisition of Reliable Depth for Multi-View 3D Object Detection 2023 BEVDepth reliable depth for multi-view 3D detection
watch BEVStereo: Enhancing Depth Estimation in Multi-View 3D Object Detection with Temporal Stereo 2023 auto score=48
watch Occ3D: A Large-Scale 3D Occupancy Prediction Benchmark for Autonomous Driving 2023 auto score=41

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)

Section titled “基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)”

近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)

Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”

观察清单(选题 8 · 可学习 8 · 待获取 PDF 0)

Section titled “观察清单(选题 8 · 可学习 8 · 待获取 PDF 0)”

成熟度 developing · 内容数 20 · 论文池 16