多模态感知与融合
多模态感知与融合
Section titled “多模态感知与融合”融合视觉、语言、点云与时序信号的多模态感知能力。
类型 Topics · 更新 2026-07-19
本 Topic 要解决什么
Section titled “本 Topic 要解决什么”本Topic解决自动驾驶中多传感器(相机、LiDAR、雷达)数据融合以实现鲁棒3D感知与场景理解的核心问题。单一模态存在固有局限:相机受光照天气影响大、LiDAR点云稀疏成本高、雷达分辨率低但全天候可用。融合需攻克跨模态语义对齐、空间校准、视角变换、特征交互及统一表征(尤其BEV)等挑战,支持3D目标检测、多任务感知与占用估计。依托nuScenes与Waymo数据集,覆盖从中心点融合、深度融合、Transformer交互到统一BEV表征(BEVFusion风格)与查询式多视角检测(DETR3D)等方法,提升复杂环境下的精度与鲁棒性,为下游规划提供可靠输入,同时避免传统深度估计误差累积。
非目标 / 边界
Section titled “非目标 / 边界”- 纯单模态感知的优化细节
- 多目标跟踪与关联算法(见相邻ad-perception-tracking)
- 端到端规划控制或决策
- 非自动驾驶场景的通用视觉-语言融合实现
- 传感器硬件标定与时间同步工程细节
- 具体对抗攻击防御代码实现
foundations— 需掌握基础3D目标检测、点云与图像特征提取、坐标系变换与投影几何spatial-perception— BEV与空间统一表征是多模态融合的常用中间表示,理解视角变换基础ad-perception-tracking— 感知输出常作为跟踪输入,需了解检测基线与多视角问题定义
| 术语 | 含义 | 常见混淆 |
|---|---|---|
| BEV (Bird’s-Eye-View) | 鸟瞰图统一表征,将多视角或多模态特征投影到地面平面网格,便于融合与下游任务 | 易与透视视图或点云直接混淆,BEV便于规划但可能丢失精细高度信息 |
| 传感器融合 (Sensor Fusion) | 整合多传感器数据以提升感知鲁棒性与精度,分为早期、中期、晚期融合策略 | 不等于简单特征拼接,需处理对齐、交互与互补性 |
| LiDAR-Camera Fusion | 激光点云几何信息与相机语义纹理的融合,常用于3D目标检测 | 投影误差、密度差异与特征层级选择是关键难点 |
| Radar-Camera Fusion | 毫米波雷达速度/全天候信息与相机语义的融合,弥补雷达稀疏与垂直分辨率不足 | 雷达点极稀疏噪声大,直接拼接效果差,需语义引导对齐 |
| Query-based Detection | 以可学习3D物体查询与多视角2D特征交互实现检测(如DETR3D),端到端set预测 | 与anchor-based或密集BEV预测不同,避免NMS与稠密深度估计 |
| Unified BEV Representation | 将不同模态特征统一投影至BEV空间后再融合与多任务解码(如BEVFusion风格) | 与模态独立特征直接交叉注意力对比,强调共享表征空间 |
方法谱系与时间线
Section titled “方法谱系与时间线”早期多模态工作多依赖后融合或简单拼接,易忽略语义对齐与跨模态相关性。随后出现中心点雷达-相机融合、深度LiDAR-Camera融合及Transformer交互融合。BEV统一表征范式兴起,将相机与LiDAR等投影至鸟瞰图实现多任务多传感器高效融合。查询式方法如DETR3D通过3D-to-2D交互避免深度估计误差与NMS。雷达-相机工作进一步强调语义对齐与全局注意力。整体从模态独立处理转向端到端统一表征与注意力交互。
- (2018) needs-review — Sensors and Sensor Fusion in Autonomous Vehicles
- (2019) foundational — Adversarial Sensor Attack on LiDAR-based Perception in Autonomous Driving
- (2020) foundational — CenterFusion: Center-based Radar and Camera Fusion for 3D Object Detection
- (2021) foundational — DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D Queries
- (2021) watch — RODNet: A Real-Time Radar Object Detection Network Cross-Supervised by Camera-Radar Fused Object 3D Localization
- (2021) watch — Sensor and Sensor Fusion Technology in Autonomous Vehicles: A Review
- (2022) recent — DeepFusion: Lidar-Camera Deep Fusion for Multi-Modal 3D Object Detection
- (2022) needs-review — Delving into the Devils of Bird’s-eye-view Perception: A Review, Evaluation and Recipe
- (2022) watch — TransFusion: Robust LiDAR-Camera Fusion for 3D Object Detection with Transformers
- (2023) recent — MVFusion: Multi-View 3D Object Detection with Semantic-aligned Radar and Camera Fusion
- (2023) watch — FUTR3D: A Unified Sensor Fusion Framework for 3D Detection
- (2023) watch — BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird’s-Eye View Representation
- (2023) needs-review — Bridging the View Disparity Between Radar and Camera Features for Multi-Modal Fusion 3D Object Detection
- (2024) recent — IS-Fusion: Instance-Scene Collaborative Fusion for Multimodal 3D Object Detection
- (2024) recent — RCBEVDet: Radar-camera Fusion in Bird’s Eye View for 3D Object Detection
- (2024) watch — A Survey on Occupancy Perception for Autonomous Driving: The Information Fusion Perspective
- (2024) watch — SimpleBEV: Improved LiDAR-Camera Fusion Architecture for 3D Object Detection
- (2024) needs-review — Emerging Trends in Autonomous Vehicle Perception: Multimodal Fusion for 3D Object Detection
- (2025) needs-review — BEVMOSNet: Multimodal Fusion for BEV Moving Object Segmentation
- (2025) recent — Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
- (2025) watch — Attention-Based LiDAR–Camera Fusion for 3D Object Detection in Autonomous Driving
- BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird’s-Eye View Representation(精读)— 统一BEV表征的多任务多传感器融合框架核心代表,体现BEVFusion/CMT风格工作,连接相机-LiDAR融合与多任务感知流水线
- DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D Queries(中文笔记)— 奠基性多视角相机3D检测,用3D查询投影与2D特征交互,避免稠密深度估计与NMS,是查询式多模态感知重要基石,附中文笔记
- MVFusion: Multi-View 3D Object Detection with Semantic-aligned Radar and Camera Fusion(中文笔记)— 首个探索多视角雷达-相机语义对齐融合的工作,针对直接拼接问题提出对齐与交叉注意力机制,对鲁棒融合有直接启发,附中文笔记
推荐阅读路径
Section titled “推荐阅读路径”- 阅读BEV感知综述(Delving into the Devils of Bird’s-eye-view Perception)理解视角变换、融合挑战与工程配方
- 精读DETR3D掌握查询式多视角3D检测与无深度估计思路
- 学习BEVFusion与TransFusion理解统一BEV表征与Transformer鲁棒融合
- 对比雷达相关工作如CenterFusion、MVFusion、RCBEVDet,关注语义对齐与稀疏处理
- 扩展阅读DeepFusion、IS-Fusion、SimpleBEV、FUTR3D等近期架构及占用感知综述,结合nuScenes/Waymo思考泛化
| Paper | 输入 | 输出 | 表示 | 训练目标 |
|---|---|---|---|---|
| CenterFusion | Radar + Camera | 3D Object Detection | Center-based fusion | 中心点雷达-相机特征融合提升3D检测 |
| BEVFusion | LiDAR + Camera multi-sensor | Multi-task perception | Unified Bird’s-Eye View | 统一BEV表征实现多任务多传感器融合 |
| DETR3D | Multi-view Images | 3D Object Detection | 3D-to-2D Queries | 端到端set-to-set检测,避免深度估计与NMS |
| MVFusion | Multi-view Radar + Camera | 3D Object Detection | Semantic-aligned + cross-attention | 语义对齐雷达特征与全局融合 |
| TransFusion | LiDAR + Camera | 3D Object Detection | Transformer-based fusion | 鲁棒LiDAR-Camera特征交互融合 |
| DeepFusion | LiDAR + Camera | Multi-Modal 3D Object Detection | — | 深度融合架构提升多模态3D检测 |
工程实现与复现风险
Section titled “工程实现与复现风险”- 跨模态标定与时间同步误差导致投影与特征错位
- BEV变换与Transformer融合的计算开销与实时性约束
- 传感器部分失效时的鲁棒降级与不确定性建模不足
- 不同天气/场景域适应与标注成本高
- 特征对齐不当引入噪声或模态主导偏差
- 对抗攻击风险(如针对LiDAR感知)与安全验证
- 如何更有效处理雷达垂直分辨率缺失与点云极度稀疏问题
- 统一BEV表征在动态场景与多任务(检测+占用)的最优配方与扩展
- 查询式方法向雷达、占用感知及更多模态的推广
- 低成本/异构传感器配置下的融合泛化与校准鲁棒性
- 多模态融合与视觉-语言模型结合的具身感知路径
- 占用感知信息融合视角下的长期挑战与标准
Topic 自测清单
Section titled “Topic 自测清单”- 简述BEV统一表征在多模态(相机-LiDAR)融合中的主要优势与面临的视角变换挑战。
- 比较早期/晚期融合与BEV统一融合(如BEVFusion风格)在特征交互与多任务支持上的异同。
- DETR3D如何通过3D查询与2D特征交互避免传统多视角检测的稠密深度估计误差与NMS后处理?
- 雷达-相机融合中为何需要语义对齐(而非直接拼接)?结合MVFusion思路说明。
- 列举至少两种LiDAR-Camera融合方法(如TransFusion、DeepFusion或SimpleBEV),并对比其核心表征或目标。
选篇附录(registry)
Section titled “选篇附录(registry)”本 Topic registry 入选 21 篇(foundational/recent/watch 见 papers.yml)。
子 Topic
Section titled “子 Topic”论文池(FRW)
Section titled “论文池(FRW)”来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5。
可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。
基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)
Section titled “基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)”- DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D Queries (2021) · 固定 · 中文笔记
- CenterFusion: Center-based Radar and Camera Fusion for 3D Object Detection (2020) · 固定 · 中文笔记
- Adversarial Sensor Attack on LiDAR-based Perception in Autonomous Driving (2019) · 待获取 PDF
近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)
Section titled “近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)”- RCBEVDet: Radar-camera Fusion in Bird’s Eye View for 3D Object Detection (2024) · 固定 · 中文笔记
- DeepFusion: Lidar-Camera Deep Fusion for Multi-Modal 3D Object Detection (2022) · 精读
- IS-Fusion: Instance-Scene Collaborative Fusion for Multimodal 3D Object Detection (2024) · 中文笔记
- Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision (2025) · 中文笔记
- MVFusion: Multi-View 3D Object Detection with Semantic-aligned Radar and Camera Fusion (2023) · 中文笔记
观察清单(选题 8 · 可学习 5 · 待获取 PDF 3)
Section titled “观察清单(选题 8 · 可学习 5 · 待获取 PDF 3)”- TransFusion: Robust LiDAR-Camera Fusion for 3D Object Detection with Transformers (2022) · 中文笔记
- RODNet: A Real-Time Radar Object Detection Network Cross-Supervised by Camera-Radar Fused Object 3D Localization (2021) · 中文笔记
- A Survey on Occupancy Perception for Autonomous Driving: The Information Fusion Perspective (2024) · 中文笔记
- SimpleBEV: Improved LiDAR-Camera Fusion Architecture for 3D Object Detection (2024) · 中文笔记
- Attention-Based LiDAR–Camera Fusion for 3D Object Detection in Autonomous Driving (2025) · 中文笔记
- BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird’s-Eye View Representation (2023) · 待获取 PDF
- Sensor and Sensor Fusion Technology in Autonomous Vehicles: A Review (2021) · 待获取 PDF
- FUTR3D: A Unified Sensor Fusion Framework for 3D Detection (2023) · 待获取 PDF
聚合内容(子树)
Section titled “聚合内容(子树)”成熟度 seed · 内容数 52 · 论文池 16