跳转到内容

M-BEV: Masked BEV Perception for Robust Autonomous Driving

M-BEV: Masked BEV Perception for Robust Autonomous Driving

Section titled “M-BEV: Masked BEV Perception for Robust Autonomous Driving”

⚠️ AI 生成 · 建议对照原文 本页为自动整理的学习笔记;关键数据与引用如需引用,请回查 PDF / 官方版本。

学习档位 中文笔记

类型 文献 · 更新 2026-07-19

所属 场景表示与长期记忆 · 基准、评测与安全

中文学习笔记(自动生成,需核验)

Section titled “中文学习笔记(自动生成,需核验)”

Topic: scene-representation-memory · Tier: recent · Year: 2023 · Venue:
Evidence level: partial · 本地全文: 是 · 建议阅读: ~40 分钟
Paper: https://arxiv.org/abs/2312.12144
Code:
Generator: grok

现有BEV多相机感知假设所有相机始终正常工作,但真实驾驶中相机故障会导致性能大幅下降(如PETRv2后视缺失NDS/mAP显著掉点),本文提出轻量可插拔的掩码重建框架,首次以纯相机自监督方式提升该场景鲁棒性,对自动驾驶安全与可靠性有直接价值。

M-BEV通过训练时随机掩码多相机视图特征并用剩余视图的时空上下文自监督重建,使BEV模型在测试时能有效恢复缺失视角并保持准确3D感知。

BEV-based 3D感知在理想全相机输入下有效,但实际驾驶中一个或多个相机可能失效,导致对应视觉线索缺失,现有模型性能严重劣化(例如后视相机缺失时PETRv2的NDS下降12.4%、mAP下降18.0%),威胁系统安全。

多视图相机BEV 3D目标检测基础(如PETR系列、BEVStereo)、特征级BEV表示与3D位置编码、Masked Autoencoders(MAE)风格自监督、NuScenes多相机时序数据与NDS/mAP指标。

  • 提出通用Masked BEV(M-BEV)框架,通过端到端训练中的随机视图掩码与重建提升对相机故障场景的鲁棒性。
  • 设计Masked View Reconstruction(MVR)模块(含Global与Local两种),利用剩余视图的时空重叠上下文自监督重建被掩码视图特征,可即插即用。
  • 与MAE在掩码目标(整视图而非图像块)、掩码比例策略(不同epoch变化以覆盖多种缺失组合)、测试使用方式(保留解码器重建用于感知)上有明确区别。
  • 在NuScenes上验证,可显著提升SOTA模型在各种缺失视图场景的性能(如后视缺失时PETRv2 mAP提升10.3%),且额外延迟极低(约0.6ms),并声称是首个纯相机方案解决此类view failure问题。

多相机图像(含t-1与t时序)经视觉编码器E得到2D特征 → Random View Masking(RVM)随机掩码若干视图的特征(同时掩码同一视图的t-1与t) → Masked View Reconstruction(MVR,Global或Local)用剩余视图特征+3D位置编码经轻量特征解码器重建被掩码特征 → 重建后特征送入translator+检测解码器D完成3D目标检测。训练时进行掩码+自监督重建;测试时保留MVR重建缺失视图特征用于感知(正常全视图时也可直接忽略MVR)。

RVM:不同训练epoch随机选择不同数量的视图进行掩码,以覆盖多种可能缺失组合(区别于MAE固定比例)。MVR Global:拼接所有视图(缺失处填可学习mask token),加3D位置编码P3D,经transformer特征解码器重建;MVR Local:利用相邻视图空间重叠,将被掩码视图分成左/中/右部分,左/右部分用相邻视图对应侧的特征均值填充,中部用mask token,以减少无关噪声。设计取舍:在特征级而非像素级重建,避免重复过编码器;利用BEV相机间固有时空重叠;Local相对Global更聚焦邻域相关性;额外计算极轻。

NuScenes基准;在PETRv2与BEVStereo上实现(因精度-效率平衡及计算资源限制);评估3D目标检测指标NDS与mAP;设置各种相机缺失场景(如后视缺失等)进行鲁棒性测试,并报告推理延迟增量。

后视相机缺失时,M-BEV使PETRv2获得10.3% mAP提升;基线PETRv2在后视缺失时NDS下降12.4%、mAP下降18.0%;额外推理开销约0.6ms。其他具体数值与消融待来源核验。

摘录中未系统讨论失败场景与适用边界;仅在有限计算资源下于PETRv2与BEVStereo上验证;重建质量依赖视图间重叠与掩码策略,极端多视图同时缺失时效果待进一步确认。待来源核验。

与前序 / 同期 / 后续方法的关系

Section titled “与前序 / 同期 / 后续方法的关系”

前序BEV多视图检测(OFT、PETR/PETRv2、BEVDepth/BEVStereo等)依赖理想全相机输入,故障时性能崩溃;RoboBEV关注自然/对抗腐蚀基准,MetaBEV用相机+LiDAR跨模态融合;掩码视觉建模(MAE、BEiT、VideoMAE等)启发但掩码目标、策略与测试使用不同。本文定位为首个纯相机方案针对view failure的鲁棒BEV感知。

摘录中未提及官方代码仓库或复现细节。建议基于公开PETRv2/BEVStereo代码库插入RVM+MVR模块,使用NuScenes官方划分,严格复现不同epoch变化掩码数量与Global/Local配置;计算资源有限时可先验证后视单缺失场景。待来源核验。

先读Abstract与Introduction(含Figure 1动机对比)理解问题与总体范式;再读Related Work把握与MAE及现有BEV的差异;重点精读Method(Overall Architecture、MVR Global/Local设计与Figure 2/3、训练测试流程);最后看实验设置与结果部分(摘录不完整时结合图表)。

  1. Q: M-BEV的核心动机是什么?现有BEV方法在相机故障时表现如何? A: 真实驾驶中相机可能失效导致视觉线索缺失;现有方法性能大幅下降,例如PETRv2后视缺失时NDS降12.4%、mAP降18.0%。
  2. Q: MVR与MAE的主要区别有哪些? A: 掩码目标不同(整视图图像 vs 图像内patch);掩码比例策略不同(不同epoch变化以覆盖多种缺失 vs 固定比例);测试时MVR保留解码器用于重建感知,而MAE主要用编码器。
  3. Q: Global MVR与Local MVR的设计差异是什么? A: Global用所有剩余视图+mask token+3D PE经解码器重建;Local利用相邻视图重叠,将掩码视图分左/中/右,左/右用邻视图对应侧特征均值填充、中部用mask token,减少噪声。
  4. Q: 为什么选择在特征级而非像素级重建? A: 像素级重建需再次过编码器才能用于检测,流程冗余计算量大;特征级可直接复用现有编码器特征并送入后续检测解码器。
  5. Q: 训练时RVM如何设置掩码以覆盖多种故障场景? A: 在不同训练epoch随机选择不同数量的相机视图进行掩码(同时掩同一视图的t-1与t帧),而非固定比例。
  • page 1 Abstract: we propose a generic Masked BEV (M-BEV) perception framework, which can effectively improve robustness to this challenging scenario, by random masking and reconstructing camera views in the end-to-end training. … for the absence of back view, our M-BEV promotes the PETRv2 model with 10.3% mAP gain.
  • page 1 Introduction: the NDS and mAP of PETRv2 (Liu et al. 2023) have a decrease of 12.4% and 18.0% respectively when the back camera view is missing
  • page 1-2 Introduction: there are two critical differences between our MVR and MAE … First, the masking goal and design are different. … Second, the training and testing manners are different. … our MVR uses the different proportion for masking images of six views in the different epochs
  • page 2 Related Work: As far as we know, our M-BEV is the first camera-only solution for such view failure with great robustness.
  • page 3 Method: we use RVM module to randomly mask the features of several camera views. Note that in real situation, for the missing views, all previous frames of this view are lost, so we mask both frames from t − 1 and t.
  • page 3-4 Method: Umask = Decoder(C[Vmask , Frest ] + P3D ) … we propose to design a local MVR module, which uses the relevant context from the neighboring views to recover the missing views.
  • page 4 Method (Training): randomly select different number of camera views in different training epochs … This is different from the training style of MAE … where the same masking proportion is adopted in all the epochs.
  • page 1 Abstract / page 2: while only takes extra 0.6ms for once response. … We implement our general M-BEV framework on two state-of-the-art BEV-based models, i.e., PETRv2 … and BEVStereo …
  • topic: multimodal-perception
  • sources: arxiv, openalex
  • retrieved_at: 2026-07-20
  • query: camera lidar fusion 3D detection autonomous driving
  • arxiv: 2312.12144
  • doi: 10.1609/aaai.v38i2.27880
  • score_total: 59
  • suggested_tier: recent

(no prose relevance explanation — numeric score only or HTTP source)

(no snippet evidence in candidate pool)

生成:2026-07-21 · 来源条数 2 · 模型 heuristic · 需人工核验数字

围绕「M-BEV: Masked BEV Perception for Robust Autonomous Driving」的核心问题与动机(待结合全文核验)。

  • 见原文方法章节;以下为基于摘要/摘录的要点提示。
  • M-BEV: Masked BEV Perception for Robust Autonomous Driving Siran Chen1…

与相近工作的关系待核验;请对照 related work。

  • 勿仅凭摘要推断未给出的数值指标。
  1. 这篇工作的输入/输出表示是什么?(M-BEV: Masked BEV Perception for Robust Autonomous Driving)
  2. 训练目标与评测协议各是什么?
  3. 主要失败模式或局限是什么?
flowchart LR
A["输入 / 观测"] --> B["表示 / 编码"]
B --> C["推理 / 解码"]
C --> D["输出 / 动作或检测"]
%% method sketch for: M-BEV: Masked BEV Perception for Robust Autonomous Driving

方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。

M-BEV: Masked BEV Perception for Robust Autonomous Driving arch p.1

来源:原论文约 p.1(arch);学习用途摘录。

M-BEV: Masked BEV Perception for Robust Autonomous Driving table p.5

来源:原论文约 p.5(table);学习用途摘录。

展开英文 Paper Card / AI deep analysis
Field Content
Year 2023
Authors Siran Chen, Yue Ma, Yu Qiao, Yali Wang
arXiv 2312.12144
DOI 10.1609/aaai.v38i2.27880
Topics scene-representation-memory, benchmark-eval-safety
Paper https://arxiv.org/abs/2312.12144
展开 Extract / Selections / Local assets
  • scene-representation-memory: tier=recent rank=1 score=63 — auto refresh 2026-07-19 sources=arxiv,crossref
  • benchmark-eval-safety: tier=watch rank=5 score=51 — cross-topic assign from registry title match=1 keywords; 2026-07-19
M-BEV: Masked BEV Perception for Robust Autonomous Driving
Siran Chen1,2 , Yue Ma 4 , Yu Qiao1, 3 , Yali Wang1, 3, *
1
Shenzhen Institute of Advanced Technology, Chinese Academy of Science, Shenzhen, China
2
School of Artificial Intelligence, University of Chinese Academy of Science, Beijing, China
3
Shanghai Artificial Intelligence Laboratory, Shanghai, China
4
Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China
Chensiran17@mails.ucas.ac.cn, y-ma21@mails.Tsinghua.edu.cn,
{yu.qiao, yl.wang}@siat.ac.cn
arXiv:2312.12144v1 [cs.CV] 19 Dec 2023
Abstract BEV-Based Paradigm SOTA Comparison
PETRv2 Our MVR
Train
46
E D 41
3D perception is a critical problem in autonomous driving.