跳转到内容

端到端驾驶

端到端感知-预测-规划一体化驾驶模型(UniAD、VAD、SparseDrive、DiffusionDrive、RAD、Senna 等)。

类型 Topics · 更新 2026-07-20

本Topic聚焦端到端自动驾驶(E2E AD)主线,旨在解决传统模块化系统(感知-预测-规划-控制分离)因接口刚性、误差累积与通信瓶颈导致的扩展性差、新场景适应性弱问题;同时应对专用E2E模型泛化不足、闭源MLLM限制社区复现、规划与人类认知层次错位(缺乏全局-局部感知及意图-轨迹双层机制)、过度依赖全局聚合运动特征而忽视关键局部交互智能体等核心痛点。通过规划导向架构、轨迹评分、扩散规划、向量化场景表示、VLM融合与认知层次引导等方法,实现从传感器输入直接到轨迹/控制的统一学习,提升多模态轨迹多样性与合理性、闭环安全性、长尾鲁棒性,并在nuScenes、Bench2Drive、NAVSIM、CARLA等基准上推动开环/闭环评估。目标是构建可扩展、可解释、与人类驾驶认知更对齐的E2E驾驶策略,覆盖主线如DiffusionDrive、SparseDrive系列及近期VLM/认知增强工作。

  • 不深入传统模块化流水线的单模块优化细节
  • 不覆盖纯规则或混合系统的工程部署实现
  • 不提供具体数值指标对比或未给出实验数字的复现结果
  • 不扩展到非驾驶具身智能或纯强化学习控制理论
  • foundations — 需掌握自动驾驶感知基础、轨迹表示与基本规划概念,以便理解E2E统一建模
  • end-to-end-learning — 理解端到端学习范式、损失设计与从传感器到动作的直接映射
  • diffusion-models — 为理解扩散规划与截断扩散在轨迹生成中的应用做准备
术语 含义 常见混淆
端到端驾驶 从原始传感器输入直接映射到规划轨迹或控制信号的统一神经网络策略,消除模块接口 常与模块化系统混淆,后者有显式中间表示与独立训练
规划导向 以规划任务为核心目标,反向引导感知与预测表示学习的E2E范式 区别于感知优先或检测导向的中间任务堆叠
轨迹评分 对候选多模态轨迹进行质量/可行性打分以选择最优输出的机制 易与纯回归轨迹预测混淆,评分强调排序与选择
扩散规划 利用扩散模型(含截断变体)生成或优化多模态驾驶轨迹的规划方法 不同于传统确定性回归或GAN生成,强调噪声迭代去噪过程
向量化场景 将地图、智能体与交互以稀疏向量/图结构表示,替代密集BEV特征 与栅格化BEV表示相对,强调效率与可解释交互
认知层次 模拟人类从全局到局部感知、从意图到轨迹规划的层次机制 区别于扁平单阶段感知-规划,强调不确定性双层建模

早期自动驾驶依赖模块化流水线,误差传播与接口刚性限制扩展。随后E2E学习直接从感知到控制,但初期泛化弱且黑盒。近年转向规划导向架构,结合向量化场景、轨迹评分与扩散模型实现多模态合理轨迹;进一步引入VLM/MLLM与认知层次,对齐人类驾驶意图并提升开放场景鲁棒性。当前主线从UniAD/VAD式统一到SparseDrive/DiffusionDrive式稀疏高效与生成式规划演进。

  1. End-to-End Autonomous Driving: Challenges and Frontiers(精读)— foundational综述,系统梳理E2E挑战、前沿与评估范式,奠定主线认知基础
  2. DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving(精读)— 主线近期工作,展示截断扩散在E2E规划中的高效多模态轨迹生成
  3. CogAD: Cognitive-Hierarchy Guided End-to-End Autonomous Driving(中文笔记)— 引入认知层次解决感知-规划与人类错位问题,有中文笔记辅助理解
  1. 先读挑战与前沿综述,建立E2E问题空间与评估框架
  2. 再读DiffusionDrive等扩散规划主线,理解生成式轨迹范式
  3. 接着读CogAD与FocalAD,掌握认知层次与局部交互聚焦
  4. 补充OpenEMMA与Senna系列,理解VLM/MLLM开源融合
  5. 最后对比SparseDriveV2轨迹评分与RAD强化学习扩展,形成完整技术图谱
Paper 输入 输出 表示 训练目标
DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving 传感器/场景特征 多模态轨迹 截断扩散过程 高效生成合理驾驶轨迹
CogAD: Cognitive-Hierarchy Guided End-to-End Autonomous Driving 多模态感知输入 意图-轨迹双层规划 全局-局部层次 + 不确定性 对齐人类认知的全面场景理解与多样轨迹
FocalAD: Local Motion Planning for End-to-End Autonomous Driving 场景与邻车运动 聚焦局部安全规划 ELAI图结构ego-centric交互 强化关键局部智能体以提升安全性
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving 多模态传感器 + MLLM 速度/曲率积分轨迹 + 3D检测 预训练MLLM + CoT推理 开源复现闭源EMMA核心功能
  • 闭环评估与真实部署差距导致sim-to-real失效
  • 多模态轨迹多样性不足引发决策振荡或保守
  • VLM/MLLM引入带来延迟与幻觉风险
  • 局部交互建模不充分在密集交通中碰撞率上升
  • 数据缩放与长尾场景覆盖不足导致泛化崩塌
  • 如何系统量化认知层次与人类驾驶对齐的收益边界
  • 扩散规划与轨迹评分的最优结合方式及计算开销权衡
  • VLM与E2E策略一致性如何在长时序决策中维持
  • 真实闭环基准(如DriveE2E)与开环指标的相关性待核验
  • 强化学习约束扩散模型在稀疏奖励驾驶中的稳定性
  1. 端到端驾驶相比模块化系统的主要优势与核心挑战是什么?
  2. 规划导向范式如何反向影响感知表示学习?举例说明。
  3. 截断扩散模型在E2E轨迹生成中相对完整扩散的取舍是什么?
  4. CogAD的认知层次如何解决现有方法与人类驾驶的错位问题?
  5. FocalAD为何强调局部邻车交互而非全局聚合,其风险是什么?

本 Topic registry 入选 22 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
needs-review OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving 2024 auto refresh 2026-07-19 sources=arxiv
watch Data Scaling Laws for End-to-End Autonomous Driving 2025 auto score=42
watch CogAD: Cognitive-Hierarchy Guided End-to-End Autonomous Driving 2025 auto refresh 2026-07-18 sources=arxiv
needs-review FocalAD: Local Motion Planning for End-to-End Autonomous Driving 2025 auto refresh 2026-07-19 sources=arxiv
watch Perception in Plan: Coupled Perception and Planning for End-to-End Autonomous Driving 2025 auto refresh 2026-07-19 sources=arxiv,crossref
watch 2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model 2025 auto score=43
watch DriveE2E: Closed-Loop Benchmark for End-to-End Autonomous Driving through Real-to-Simulation 2025 auto refresh 2026-07-19 sources=arxiv
recent DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving 2024 auto refresh 2026-07-19 sources=arxiv,openalex
watch DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving 2025
watch Diffusion Models for End-to-End Autonomous Driving: A Survey of Perception, Prediction, Planning, and Control 2026 auto score=40
watch Multimodal End-to-End Autonomous Driving 2020 auto refresh 2026-07-19 sources=openalex
foundational End-to-End Autonomous Driving: Challenges and Frontiers 2024 auto refresh 2026-07-19 sources=openalex
recent GTRS: Generalized Trajectory Scoring for End-to-end Multimodal Planning 2025 auto refresh 2026-07-19 sources=arxiv,openalex
recent RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS and Reinforcement Learning 2025
needs-review RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework for End-to-End Driving 2026
recent Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving 2024
needs-review Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making 2026
needs-review SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving 2026
recent SparseDrive 文献笔记 2024 ICLR 2025 SparseDrive — sparse perception-to-planning; stron
needs-review SSR: Navigation-guided Sparse Scene Representation for End-to-End Autonomous Driving 2024
foundational UniAD: Planning-oriented Autonomous Driving 2022 CVPR 2023 UniAD — planning-oriented unified AD; defines mult
foundational VAD: Vectorized Scene Representation for Efficient Autonomous Driving 2023 ICCV 2023 VAD — vectorized scene representation for E2E plan

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)

Section titled “基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)”

近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)

Section titled “近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)”

观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)

Section titled “观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)”

成熟度 developing · 内容数 24 · 论文池 16