跳转到内容

多模态感知与融合

融合视觉、语言、点云与时序信号的多模态感知能力。

类型 Topics · 更新 2026-07-19

本Topic解决自动驾驶中多传感器(相机、LiDAR、雷达)数据融合以实现鲁棒3D感知与场景理解的核心问题。单一模态存在固有局限:相机受光照天气影响大、LiDAR点云稀疏成本高、雷达分辨率低但全天候可用。融合需攻克跨模态语义对齐、空间校准、视角变换、特征交互及统一表征(尤其BEV)等挑战,支持3D目标检测、多任务感知与占用估计。依托nuScenes与Waymo数据集,覆盖从中心点融合、深度融合、Transformer交互到统一BEV表征(BEVFusion风格)与查询式多视角检测(DETR3D)等方法,提升复杂环境下的精度与鲁棒性,为下游规划提供可靠输入,同时避免传统深度估计误差累积。

  • 纯单模态感知的优化细节
  • 多目标跟踪与关联算法(见相邻ad-perception-tracking)
  • 端到端规划控制或决策
  • 非自动驾驶场景的通用视觉-语言融合实现
  • 传感器硬件标定与时间同步工程细节
  • 具体对抗攻击防御代码实现
  • foundations — 需掌握基础3D目标检测、点云与图像特征提取、坐标系变换与投影几何
  • spatial-perception — BEV与空间统一表征是多模态融合的常用中间表示,理解视角变换基础
  • ad-perception-tracking — 感知输出常作为跟踪输入,需了解检测基线与多视角问题定义
术语 含义 常见混淆
BEV (Bird’s-Eye-View) 鸟瞰图统一表征,将多视角或多模态特征投影到地面平面网格,便于融合与下游任务 易与透视视图或点云直接混淆,BEV便于规划但可能丢失精细高度信息
传感器融合 (Sensor Fusion) 整合多传感器数据以提升感知鲁棒性与精度,分为早期、中期、晚期融合策略 不等于简单特征拼接,需处理对齐、交互与互补性
LiDAR-Camera Fusion 激光点云几何信息与相机语义纹理的融合,常用于3D目标检测 投影误差、密度差异与特征层级选择是关键难点
Radar-Camera Fusion 毫米波雷达速度/全天候信息与相机语义的融合,弥补雷达稀疏与垂直分辨率不足 雷达点极稀疏噪声大,直接拼接效果差,需语义引导对齐
Query-based Detection 以可学习3D物体查询与多视角2D特征交互实现检测(如DETR3D),端到端set预测 与anchor-based或密集BEV预测不同,避免NMS与稠密深度估计
Unified BEV Representation 将不同模态特征统一投影至BEV空间后再融合与多任务解码(如BEVFusion风格) 与模态独立特征直接交叉注意力对比,强调共享表征空间

早期多模态工作多依赖后融合或简单拼接,易忽略语义对齐与跨模态相关性。随后出现中心点雷达-相机融合、深度LiDAR-Camera融合及Transformer交互融合。BEV统一表征范式兴起,将相机与LiDAR等投影至鸟瞰图实现多任务多传感器高效融合。查询式方法如DETR3D通过3D-to-2D交互避免深度估计误差与NMS。雷达-相机工作进一步强调语义对齐与全局注意力。整体从模态独立处理转向端到端统一表征与注意力交互。

  1. BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird’s-Eye View Representation(精读)— 统一BEV表征的多任务多传感器融合框架核心代表,体现BEVFusion/CMT风格工作,连接相机-LiDAR融合与多任务感知流水线
  2. DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D Queries(中文笔记)— 奠基性多视角相机3D检测,用3D查询投影与2D特征交互,避免稠密深度估计与NMS,是查询式多模态感知重要基石,附中文笔记
  3. MVFusion: Multi-View 3D Object Detection with Semantic-aligned Radar and Camera Fusion(中文笔记)— 首个探索多视角雷达-相机语义对齐融合的工作,针对直接拼接问题提出对齐与交叉注意力机制,对鲁棒融合有直接启发,附中文笔记
  1. 阅读BEV感知综述(Delving into the Devils of Bird’s-eye-view Perception)理解视角变换、融合挑战与工程配方
  2. 精读DETR3D掌握查询式多视角3D检测与无深度估计思路
  3. 学习BEVFusion与TransFusion理解统一BEV表征与Transformer鲁棒融合
  4. 对比雷达相关工作如CenterFusion、MVFusion、RCBEVDet,关注语义对齐与稀疏处理
  5. 扩展阅读DeepFusion、IS-Fusion、SimpleBEV、FUTR3D等近期架构及占用感知综述,结合nuScenes/Waymo思考泛化
Paper 输入 输出 表示 训练目标
CenterFusion Radar + Camera 3D Object Detection Center-based fusion 中心点雷达-相机特征融合提升3D检测
BEVFusion LiDAR + Camera multi-sensor Multi-task perception Unified Bird’s-Eye View 统一BEV表征实现多任务多传感器融合
DETR3D Multi-view Images 3D Object Detection 3D-to-2D Queries 端到端set-to-set检测,避免深度估计与NMS
MVFusion Multi-view Radar + Camera 3D Object Detection Semantic-aligned + cross-attention 语义对齐雷达特征与全局融合
TransFusion LiDAR + Camera 3D Object Detection Transformer-based fusion 鲁棒LiDAR-Camera特征交互融合
DeepFusion LiDAR + Camera Multi-Modal 3D Object Detection 深度融合架构提升多模态3D检测
  • 跨模态标定与时间同步误差导致投影与特征错位
  • BEV变换与Transformer融合的计算开销与实时性约束
  • 传感器部分失效时的鲁棒降级与不确定性建模不足
  • 不同天气/场景域适应与标注成本高
  • 特征对齐不当引入噪声或模态主导偏差
  • 对抗攻击风险(如针对LiDAR感知)与安全验证
  • 如何更有效处理雷达垂直分辨率缺失与点云极度稀疏问题
  • 统一BEV表征在动态场景与多任务(检测+占用)的最优配方与扩展
  • 查询式方法向雷达、占用感知及更多模态的推广
  • 低成本/异构传感器配置下的融合泛化与校准鲁棒性
  • 多模态融合与视觉-语言模型结合的具身感知路径
  • 占用感知信息融合视角下的长期挑战与标准
  1. 简述BEV统一表征在多模态(相机-LiDAR)融合中的主要优势与面临的视角变换挑战。
  2. 比较早期/晚期融合与BEV统一融合(如BEVFusion风格)在特征交互与多任务支持上的异同。
  3. DETR3D如何通过3D查询与2D特征交互避免传统多视角检测的稠密深度估计误差与NMS后处理?
  4. 雷达-相机融合中为何需要语义对齐(而非直接拼接)?结合MVFusion思路说明。
  5. 列举至少两种LiDAR-Camera融合方法(如TransFusion、DeepFusion或SimpleBEV),并对比其核心表征或目标。

本 Topic registry 入选 21 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
foundational CenterFusion: Center-based Radar and Camera Fusion for 3D Object Detection 2020 CenterFusion radar+camera center-based fusion
watch RODNet: A Real-Time Radar Object Detection Network Cross-Supervised by Camera-Radar Fused Object 3D Localization 2021 auto refresh 2026-07-19 sources=arxiv,openalex
recent DeepFusion: Lidar-Camera Deep Fusion for Multi-Modal 3D Object Detection 2022 auto refresh 2026-07-19 sources=arxiv,openalex
needs-review Delving into the Devils of Bird’s-eye-view Perception: A Review, Evaluation and Recipe 2022 auto refresh 2026-07-19 sources=openalex
recent MVFusion: Multi-View 3D Object Detection with Semantic-aligned Radar and Camera Fusion 2023 auto refresh 2026-07-19 sources=arxiv,openalex
recent IS-Fusion: Instance-Scene Collaborative Fusion for Multimodal 3D Object Detection 2024 auto refresh 2026-07-19 sources=arxiv,openalex
recent RCBEVDet: Radar-camera Fusion in Bird’s Eye View for 3D Object Detection 2024 RCBEVDet radar-camera BEV fusion for 3D detection
watch A Survey on Occupancy Perception for Autonomous Driving: The Information Fusion Perspective 2024 auto score=43
watch SimpleBEV: Improved LiDAR-Camera Fusion Architecture for 3D Object Detection 2024 auto score=41
needs-review BEVMOSNet: Multimodal Fusion for BEV Moving Object Segmentation 2025 auto refresh 2026-07-19 sources=arxiv,crossref
recent Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision 2025 auto refresh 2026-07-19 sources=arxiv,openalex
foundational DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D Queries 2021 DETR3D multi-view 3D detection anchors camera-centric multim
watch TransFusion: Robust LiDAR-Camera Fusion for 3D Object Detection with Transformers 2022 auto refresh 2026-07-19 sources=openalex
watch FUTR3D: A Unified Sensor Fusion Framework for 3D Detection 2023 auto refresh 2026-07-19 sources=openalex
watch BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird’s-Eye View Representation 2023 auto refresh 2026-07-19 sources=openalex
needs-review Sensors and Sensor Fusion in Autonomous Vehicles 2018 auto refresh 2026-07-19 sources=openalex
needs-review Bridging the View Disparity Between Radar and Camera Features for Multi-Modal Fusion 3D Object Detection 2023 auto refresh 2026-07-19 sources=openalex
foundational Adversarial Sensor Attack on LiDAR-based Perception in Autonomous Driving 2019 auto refresh 2026-07-19 sources=openalex
watch Sensor and Sensor Fusion Technology in Autonomous Vehicles: A Review 2021 auto refresh 2026-07-19 sources=openalex
needs-review Emerging Trends in Autonomous Vehicle Perception: Multimodal Fusion for 3D Object Detection 2024 auto refresh 2026-07-19 sources=openalex
watch Attention-Based LiDAR–Camera Fusion for 3D Object Detection in Autonomous Driving 2025 auto score=40

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)

Section titled “基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)”

近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)

Section titled “近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)”

观察清单(选题 8 · 可学习 5 · 待获取 PDF 3)

Section titled “观察清单(选题 8 · 可学习 5 · 待获取 PDF 3)”

成熟度 seed · 内容数 52 · 论文池 16