端到端学习
从低层输入到最终任务目标进行联合优化的方法与系统问题。
类型 Topics · 更新 2026-07-19
本 Topic 要解决什么
Section titled “本 Topic 要解决什么”本Topic聚焦自动驾驶与具身智能中的端到端学习范式,旨在解决传统模块化流水线(感知-预测-规划-控制独立设计与优化)导致的误差累积、中间表示不匹配与联合次优问题。通过统一网络直接从原始传感器输入映射到轨迹/控制输出,或采用多任务联合学习与可微分规划,实现全局目标一致性优化。核心挑战包括多任务冲突平衡、场景向量化/稀疏高效表示、感知-规划耦合打破、多模态动作分布建模及可解释性与安全性保障。结合UniAD规划导向多任务、VAD向量化表示及近年E2E综述与适配器方法,建立从原理到架构演进的系统认知,支撑闭环驾驶系统构建。
非目标 / 边界
Section titled “非目标 / 边界”- 纯模块化感知或独立规划算法的细节实现
- 低层车辆动力学控制或硬件部署优化
- 通用计算机视觉目标检测(如DETR系列跨域应用)的专项训练
- 非驾驶具身任务的纯仿真强化学习基线
foundations— 需掌握深度学习基础、自动驾驶系统架构概览及传感器数据特性,才能理解端到端与模块化取舍imitation-offline— 端到端常依赖模仿学习与离线数据,需先熟悉行为克隆与分布偏移问题ad-end-to-end-driving— 相邻Topic提供具体驾驶闭环实例与扩散轨迹等方法,便于对照本Topic的方法伞
| 术语 | 含义 | 常见混淆 |
|---|---|---|
| 端到端学习 | 单一可微模型直接从原始输入(图像/点云等)映射到最终输出(轨迹/控制信号),联合优化全流程 | 易与模块化+联合微调混淆;真正E2E强调无硬编码中间接口与误差传播阻断 |
| 可微分规划 | 将规划/优化步骤设计为可反向传播的模块,使梯度可从规划损失传回感知网络 | 不同于传统不可微优化器;关键在近似或重参数化使端到端训练可行 |
| 多任务学习驾驶 | 共享骨干同时优化检测、跟踪、预测、规划等多个相关任务,利用任务间协同提升整体性能 | 需注意任务权重平衡与负迁移;非简单损失相加 |
| 规划导向 | 以最终规划/驾驶性能为中心设计网络与损失,中间任务服务于规划而非独立最优 | 与感知优先范式对比;UniAD等强调query驱动的规划查询 |
| 向量化场景表示 | 用稀疏向量/实例级特征描述地图元素、智能体与交互,替代密集BEV栅格以提升效率与可解释性 | VAD核心;不同于纯栅格或点云直接回归 |
| 感知-规划耦合屏障 | 端到端中感知特征与规划决策过度纠缠导致泛化差或难以迁移;适配器等方法尝试解耦 | DriveAdapter等针对此;完全解耦可能损失联合优势 |
方法谱系与时间线
Section titled “方法谱系与时间线”早期端到端以CNN直接回归转向角(如早期视觉控制)为主,受限于数据与解释性。随后转向多任务共享骨干与注意力机制联合优化。近年范式跃迁至规划导向多任务(UniAD)与高效向量化表示(VAD),强调从传感器到规划的统一query与稀疏交互。同时出现适配器打破耦合、扩散/多模态轨迹生成及3D基础模型先验增强视点鲁棒性,整体从黑盒回归走向结构化可微、任务协同与安全可解释方向。
- (2018) watch — End-to-end Multi-Modal Multi-Task Vehicle Control for Self-Driving Cars with Visual Perceptions
- (2019) watch — End-to-end Learning Approach for Autonomous Driving: A Convolutional Neural Network Model
- (2020) foundational — A Survey of Autonomous Driving: Common Practices and Emerging Technologies
- (2020) watch — Deformable DETR: Deformable Transformers for End-to-End Object Detection(归入
foundations集合预测主线,见该 Topic 文献池) - (2020) watch — End-to-End Object Detection with Adaptive Clustering Transformer
- (2020) watch — Explainable and Safe Learning-Based Autonomous Driving: A Survey from Modular to End-to-End Planning
- (2021) watch — Efficient DETR: Improving End-to-End Object Detector with Dense Prior
- (2021) recent — Multi-task Learning with Attention for End-to-end Autonomous Driving
- (2021) watch — Sparse DETR: Efficient End-to-End Object Detection with Learnable Sparsity
- (2021) recent — Deep learning for object detection and scene perception in self-driving cars: Survey, challenges, and open issues
- (2022) foundational — UniAD: Planning-oriented Autonomous Driving
- (2023) foundational — VAD: Vectorized Scene Representation for Efficient Autonomous Driving
- (2023) recent — DriveAdapter: Breaking the Coupling Barrier of Perception and Planning in End-to-End Autonomous Driving
- (2023) recent — Recent Advancements in End-to-End Autonomous Driving Using Deep Learning: A Survey
- (2024) recent — End-to-End Autonomous Driving: Challenges and Frontiers
- (2026) watch — Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors
- UniAD: Planning-oriented Autonomous Driving(精读)— 奠基规划导向多任务E2E架构,统一感知-预测-规划query设计,是方法伞核心锚点
- VAD: Vectorized Scene Representation for Efficient Autonomous Driving(精读)— 核心向量化E2E架构,提升效率与可解释性,与UniAD互补形成主流表示路线
- End-to-End Autonomous Driving: Challenges and Frontiers(中文笔记)— TPAMI 2024权威综述,系统梳理挑战、前沿方法与开放问题,适合建立全局视野
推荐阅读路径
Section titled “推荐阅读路径”- 先读TPAMI 2024综述与2020/2023相关Survey建立E2E vs模块化全貌与挑战清单
- 精读UniAD理解规划导向多任务与query机制,再读VAD掌握向量化表示与高效解码
- 对照DriveAdapter与Multi-task Attention等近期工作,分析耦合问题与多任务平衡,结合中文笔记验证关键设计
- 最后梳理工程风险与开放问题,尝试对比输入输出与目标函数差异
| Paper | 输入 | 输出 | 表示 | 训练目标 |
|---|---|---|---|---|
| UniAD: Planning-oriented Autonomous Driving | 多相机图像等传感器 | 规划轨迹为主,辅以检测跟踪预测 | 统一query与BEV特征 | 规划导向多任务联合损失 |
| VAD: Vectorized Scene Representation for Efficient Autonomous Driving | 传感器数据 | 向量化场景元素与驾驶动作 | 稀疏向量化实例表示 | 高效端到端规划与场景理解 |
| DriveAdapter: Breaking the Coupling Barrier of Perception and Planning in End-to-End Autonomous Driving | — | — | — | 打破感知-规划耦合以提升泛化 |
| Multi-task Learning with Attention for End-to-end Autonomous Driving | 视觉感知 | 多任务驾驶控制/决策 | 注意力机制共享特征 | 多任务联合优化驾驶 |
工程实现与复现风险
Section titled “工程实现与复现风险”- 因果混淆与虚假相关导致分布外失效(如仅模仿相关而非因果)
- 可解释性差与安全验证困难,难以满足认证与调试需求
- 多任务负迁移与损失权重敏感,训练不稳定
- 数据效率低与长尾场景覆盖不足,仿真到现实差距
- 计算实时性与稀疏/密集表示权衡,部署资源受限
- 如何系统性平衡多任务并避免负迁移同时保证规划最优
- 端到端模型的可解释性与安全边界如何形式化验证
- 视点变化、传感器噪声与域偏移下的鲁棒泛化
- 可微分规划与真实车辆动力学/交通规则的精确对齐
- 从模仿到强化学习闭环的高效安全探索机制
Topic 自测清单
Section titled “Topic 自测清单”- 端到端学习相比模块化流水线的核心优势与主要风险分别是什么?请结合误差累积说明。
- UniAD的“规划导向”体现在网络设计与损失上的哪些具体机制?与感知优先有何不同?
- VAD的向量化表示相对密集BEV有何效率与语义优势?潜在局限是什么?
- 什么是感知-规划耦合屏障?DriveAdapter类方法如何尝试缓解?
- 列举至少三个端到端驾驶中的工程风险,并简述一个可能的缓解方向。
选篇附录(registry)
Section titled “选篇附录(registry)”本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。
论文池(FRW)
Section titled “论文池(FRW)”来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5。
可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。
基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)
Section titled “基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)”- UniAD: Planning-oriented Autonomous Driving (2022) · 固定 · 中文笔记
- VAD: Vectorized Scene Representation for Efficient Autonomous Driving (2023) · 固定 · 精读
- A Survey of Autonomous Driving: Common Practices and Emerging Technologies (2020) · 中文笔记
近期重要(选题 5 · 可学习 2 · 待获取 PDF 3)
Section titled “近期重要(选题 5 · 可学习 2 · 待获取 PDF 3)”- Multi-task Learning with Attention for End-to-end Autonomous Driving (2021) · 中文笔记
- DriveAdapter: Breaking the Coupling Barrier of Perception and Planning in End-to-End Autonomous Driving (2023) · 中文笔记
- End-to-End Autonomous Driving: Challenges and Frontiers (2024) · 待获取 PDF
- Recent Advancements in End-to-End Autonomous Driving Using Deep Learning: A Survey (2023) · 待获取 PDF
- Deep learning for object detection and scene perception in self-driving cars: Survey, challenges, and open issues (2021) · 待获取 PDF
观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)
Section titled “观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)”- Deformable DETR: Deformable Transformers for End-to-End Object Detection (2020) · 精读
- End-to-End Object Detection with Adaptive Clustering Transformer (2020) · 中文笔记
- Efficient DETR: Improving End-to-End Object Detector with Dense Prior (2021) · 中文笔记
- Sparse DETR: Efficient End-to-End Object Detection with Learnable Sparsity (2021) · 中文笔记
- End-to-end Learning Approach for Autonomous Driving: A Convolutional Neural Network Model (2019) · 中文笔记
- Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors (2026) · 中文笔记
- Explainable and Safe Learning-Based Autonomous Driving: A Survey from Modular to End-to-End Planning (2020) · 中文笔记
- End-to-end Multi-Modal Multi-Task Vehicle Control for Self-Driving Cars with Visual Perceptions (2018) · 待获取 PDF
关联 Topic
Section titled “关联 Topic”成熟度 developing · 内容数 15 · 论文池 16