自动驾驶方法谱系
自动驾驶方法谱系
Section titled “自动驾驶方法谱系”类型 项目 · 更新 2026-07-20
标签 autonomous-driving · reproduction
所属 自动驾驶
本文从旧工作区迁入,关系和 SOTA 判断在逐项核验前均视为研究路线假设。
这份笔记专门整理“从哪篇论文继承而来、每一步主要解决了什么问题、又引入了什么新代价”。它不是严格引用图,也不是按发表时间机械排序,而是按复现时最有用的方法脉络组织。
调研时间:2026-07-02。除本地 PDF/代码外,本版额外参考了 arXiv 论文页、官方 GitHub/项目页,以及 OpenDriveLab 持续维护的 end-to-end autonomous driving 论文集。由于自动驾驶论文更新很快,后续推进具体复现前仍建议按项目重新核对 README、release、checkpoint 和 benchmark 版本。
如果要从任务和数据集角度阅读近三年的开源强基线,先看 任务、开源数据集与近三年开源优先 SOTA。本文只解释技术继承关系,不把每个 leaderboard 的排名写成结论。
先纠正一个常见说法:CMT -> PETR -> DETR3D -> Deformable DETR -> DETR 更像是从某篇论文往前追溯引用来源的反向链。按方法演进方向,更自然的写法是:
DETR -> Deformable DETR -> DETR3D -> PETR/PETRv2 -> StreamPETR \-> BEVFormer \-> CMT其中 CMT 是坐标编码与 camera-lidar fusion 分支,不是纯视觉 3D 检测主干的直接下一代。
联网调研后需要补充的一点是:当前工作区覆盖了视觉 3D 感知、稀疏表示、端到端规划、NAVSIM/RL/VLM 的核心开源项目,但技术谱系里还有一些“没有 clone、却影响路线判断”的关键节点,例如 DAB-DETR/DINO、BEVDet/BEVDepth/BEVFusion、SparseBEV/Far3D、TransFuser/InterFuser、GenAD、DriveLM/Agent-Driver/DriveVLM、GAIA-1/DriveDreamer/DrivingGPT、Bench2Drive/nuPlan-R 等。它们不一定都适合立即复现,但应该纳入方法地图。
0. 上游背景入口
Section titled “0. 上游背景入口”本工作区没有单独 clone DETR 和 Deformable DETR,但它们是理解后续 query-based 自动驾驶感知论文的必要背景:
- DETR: End-to-End Object Detection with Transformers
- Deformable DETR: Deformable DETR: Deformable Transformers for End-to-End Object Detection
- DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR
- DINO: DETR with Improved DeNoising Anchor Boxes
- DETR3D: 本地笔记
- PETR: 本地笔记
- BEVFormer: 本地笔记
方法上,DETR 贡献的是 set prediction 和 object queries;Deformable DETR 解决慢收敛和高分辨率特征利用不足;DAB-DETR 将 query 显式解释为可逐层更新的 anchor box;DINO 通过 denoising、query selection 和 box refinement 继续强化 DETR 家族。这些思想后来在 3D 检测里表现为 reference point、anchor/query refinement、denoising training 和多尺度稀疏采样。
1. DETR 系:从集合预测到多视角 3D 感知
Section titled “1. DETR 系:从集合预测到多视角 3D 感知”| 演进关系 | 上一步的问题 | 当前工作的优化点 | 新代价/风险 | 复现启发 |
|---|---|---|---|---|
| DETR | 传统检测依赖 anchor、NMS 和大量手工后处理。 | 把检测写成 set prediction:object queries + transformer decoder + Hungarian matching,端到端输出目标集合。 | 原始 DETR 收敛慢,小目标和高分辨率特征利用不足。 | 后续 3D query 方法的基础是“query 表示候选对象”,不是传统 dense anchor。 |
| DETR -> Deformable DETR | DETR 全局注意力成本高,收敛慢。 | 用 multi-scale deformable attention,只在少量采样点聚合特征,提升收敛和多尺度检测能力。 | 自定义 CUDA op、采样点坐标和多尺度特征对齐变成工程风险。 | BEVFormer/VAD/SSR/Sparse4D 等大量代码的 attention op 兼容问题都可以追溯到这一层。 |
| Deformable DETR -> DETR3D | 2D DETR 不知道 3D 空间;多相机 3D 检测常依赖显式深度或 BEV lift。 | 把 object query 放到 3D 空间,通过相机投影到多视角图像特征采样,直接输出 3D boxes。 | 标定、坐标系、image augmentation 后的 lidar2img 链路必须完全正确。 | 适合作为多相机 query-based 3D detection 的最小复现目标。 |
| DETR3D -> PETR | DETR3D 主要让 query 投影取样,图像 token 本身缺少显式 3D 几何信息。 | 将 3D position embedding 注入图像特征,使 decoder 与 geometry-aware image features 交互。 | 位置编码强依赖相机参数、深度范围和图像变换元信息。 | 读 PETR 时重点看 position embedding 如何随数据 pipeline 同步变化。 |
| PETR -> PETRv2 | 单帧 PETR 缺少时序信息,多任务能力有限。 | 扩展到 temporal modeling 和 unified 3D perception,可支持检测、分割等任务。 | 历史帧缓存、ego motion 对齐和多任务配置增加复杂度。 | 先跑 PETR 单帧,再尝试 PETRv2 temporal 配置。 |
| PETRv2 -> StreamPETR | dense temporal feature 或多帧重算成本高,在线推理效率受限。 | 用 object-centric temporal modeling 维护历史 query/instance memory。 | online eval loop、scene reset、memory drift 会影响真实指标。 | 复现时必须按时间顺序评测,不能把视频样本随机打乱。 |
| PETR/DETR3D -> CMT | 纯相机 3D 检测深度和遮挡能力有限;camera-lidar fusion 需要跨模态对齐。 | 用 coordinate encoding 让 image tokens 和 point tokens 在 transformer 中融合。 | 不再是纯视觉链路,需要 LiDAR、点云预处理和跨模态标定。 | CMT 更适合理解“坐标编码如何成为跨模态公共语言”。 |
这一支还有两个值得知道但当前未 clone 的后续方向。第一是 Far3D,它面向长距离 surround-view 3D detection,引入 2D object priors、3D adaptive queries、perspective-aware aggregation 和 range-modulated denoising,把 query-based 视觉 3D 检测从 nuScenes 常见近距离目标扩展到 Argoverse 2 的 150m 范围。第二是 SparseBEV,它明确站在 dense BEV 与 sparse query 之间,主张 fully sparse 3D detector,通过 scale-adaptive self-attention、adaptive spatio-temporal sampling 和 adaptive mixing 缩小稀疏检测与 dense BEV 的性能差距。
2. BEV 系:从 object query 分流到统一鸟瞰表示
Section titled “2. BEV 系:从 object query 分流到统一鸟瞰表示”| 演进关系 | 上一步的问题 | 当前工作的优化点 | 新代价/风险 | 复现启发 |
|---|---|---|---|---|
| DETR3D/PETR -> BEVFormer | object query 直接检测很适合 3D boxes,但不天然适合地图、规划等 dense/structured 下游任务。 | 用 BEV queries 构建统一鸟瞰 latent grid,通过 spatial cross-attention 融合多相机,通过 temporal self-attention 融合历史 BEV。 | BEV 分辨率、queue length、CAN bus 和 deformable attention 共同决定显存和稳定性。 | BEVFormer 是 UniAD/VAD/SSR 等端到端链路的重要基础设施。 |
| BEVFormer -> UniAD | BEV 感知本身不等于规划,检测/地图/运动/规划目标容易割裂。 | 将 detection、tracking、mapping、motion、occupancy、planning 组织成 planning-oriented 多任务系统。 | 数据、权重、info、anchors 和多阶段训练链路很长。 | 不适合第一批复现;应先跑通 BEVFormer/VAD 类基础链路。 |
| BEVFormer/UniAD -> VAD | dense BEV 表达丰富但冗余,规划真正需要的是结构化道路和 agent 关系。 | 将场景向量化,用 vectorized map/agent/motion 表示服务 planner,并加入 planning constraints。 | 仍依赖 BEVFormer 老栈、temporal infos 和 CAN bus。 | VAD 是从 dense BEV 走向规划友好表示的关键过渡。 |
| VAD/UniAD -> SSR | 显式感知任务可能与最终规划目标不完全一致,也增加系统复杂度。 | 反思端到端驾驶是否必须保留 perception tasks,强调 planning-relevant token/scene representation。 | 去掉中间任务后,可解释性和安全约束可能变弱。 | 用于比较“显式多任务监督”与“规划目标驱动表示”的差异。 |
BEV 路线还有一条没有放进当前工作区的历史分支:BEVDet/BEVDepth/BEVFusion。BEVDepth 认为深度估计是 camera-based BEV 3D detection 的关键瓶颈,通过显式深度监督、camera-aware depth 和 depth refinement 提升深度可靠性。BEVFusion 则将 camera 与 LiDAR 统一到 BEV 空间,避免传统 point-level fusion 丢失图像语义密度,并通过高效 BEV pooling 解决 view transformation 瓶颈。它们说明 BEV 路线并不只有 transformer attention 一条路,也可以从 LSS/depth/view transformation 和多传感器融合角度推进。
BEVFormer v2 进一步说明了另一个现实问题:现代图像 backbone 与 BEV detector 并不总能自然协同,因此它用 perspective supervision 帮助 BEV detector 更快收敛、更好适配现代 backbone。对复现而言,这意味着如果你迁移到新 backbone 或新 PyTorch 环境,不能只看 BEV encoder,本身的监督形式和 backbone 训练状态也会影响结果。
3. Sparse 系:从稀疏时序检测到稀疏端到端规划
Section titled “3. Sparse 系:从稀疏时序检测到稀疏端到端规划”| 演进关系 | 上一步的问题 | 当前工作的优化点 | 新代价/风险 | 复现启发 |
|---|---|---|---|---|
| BEVFormer/PETR -> Sparse4D | dense BEV 或全局 token 计算较重,历史信息利用成本高。 | 用 sparse anchor/instance representation 和 deformable aggregation 做多视角时序 3D detection。 | anchor 初始化、instance bank、自定义 op 和坐标对齐是主要风险。 | Sparse4D 适合作为 5080 上验证稀疏多视角链路的高价值项目。 |
| Sparse4D -> Sparse4Dv2 | v1 的时序融合还不够稳定,历史实例递推需要更系统设计。 | 引入 recurrent temporal fusion,把历史 instance feature 作为当前帧先验。 | top-k 保留、score 阈值、ego motion 对齐会影响长时稳定性。 | 先复现 v1,再打开 recurrent temporal 配置。 |
| Sparse4Dv2 -> Sparse4Dv3 | 检测和 tracking 后处理割裂,association 与 detection 目标不一致。 | 将 detection 与 tracking 更紧密结合,推进端到端 3D detection and tracking。 | track 生命周期、scene reset、在线评测顺序变成关键。 | 是理解 SparseDrive 动态 agent 表示的前置论文。 |
| Sparse4Dv3 -> SparseDrive | 稀疏实例只用于感知还不够,端到端规划仍可能依赖重型多任务 BEV。 | 用 sparse scene representation 统一 detection、tracking、mapping、motion prediction 和 planning。 | 稀疏 token 漏掉关键对象/地图元素时,planner 缺少 dense fallback。 | 复现 SparseDrive 前应先读 Sparse4Dv3 的 instance bank 和 tracking 逻辑。 |
| SparseDrive -> SparseDriveV2 | 端到端 planner 直接生成轨迹仍面临多模态覆盖和选择困难。 | 转向 trajectory vocabulary + scoring,强调 factorized vocabulary 和 factorized scoring。 | 候选轨迹词表与 checkpoint 必须匹配,NAVSIM 数据不可用 nuScenes mini 替代。 | 这是从“稀疏场景表示”到“轨迹评分范式”的明显转向。 |
4. 端到端规划系:中间任务到底应该保留多少
Section titled “4. 端到端规划系:中间任务到底应该保留多少”| 演进关系 | 上一步的问题 | 当前工作的优化点 | 新代价/风险 | 复现启发 |
|---|---|---|---|---|
| BEVFormer -> UniAD | 单独优化感知指标不保证最终规划安全。 | Planning-oriented 多任务链,让上游任务围绕 ego planning 组织。 | 工程链路最长,mini 数据只能做 smoke test。 | 先理解任务接口,再考虑完整训练。 |
| UniAD -> VAD | UniAD 式完整多任务链较重,dense BEV 对规划有冗余。 | 用 vectorized scene representation 和 planning constraints 强化规划相关结构。 | 对 VAD temporal infos、CAN bus、老 OpenMMLab 栈依赖强。 | 适合作为 nuScenes 端到端链路的较早复现对象。 |
| UniAD/VAD -> SparseDrive | dense BEV 和多任务 head 训练/推理成本高。 | 用 sparse-centric paradigm 统一动态 agent 和静态 map element。 | 多任务仍复杂,且强依赖 Sparse4D 风格 CUDA op。 | 先跑 Sparse4D,再看 SparseDrive。 |
| VAD/SparseDrive -> SSR | 显式 perception tasks 是否必要仍不清楚。 | 从 planning-relevant representation 角度减少或重组中间监督。 | 需要完整数据和协议才能回答论文问题,mini 无法得出结论。 | 适合做消融理解,不适合作为第一批工程基准。 |
联网调研后,端到端规划路线需要补上两类项目。第一类是 CARLA/多模态融合历史线,例如 TransFuser、InterFuser、ThinkTwice、ReasonNet 等,它们在 OpenDriveLab 论文集中被归到 multi-sensor fusion / reasoning / scalable decoders 等主题。这条线比 UniAD/VAD 更早强调闭环仿真、传感器融合和可解释中间任务。第二类是生成式端到端线,例如 GenAD,它认为传统“感知-预测-规划”逐步 pipeline 仍难以充分建模 ego 与周围交通参与者的未来共同演化,因此用 instance-centric scene tokenizer、VAE 结构潜空间和 temporal model 同时做 motion prediction 与 planning。
5. 预测与规划系:从预测别人到选择 ego 策略
Section titled “5. 预测与规划系:从预测别人到选择 ego 策略”| 演进关系 | 上一步的问题 | 当前工作的优化点 | 新代价/风险 | 复现启发 |
|---|---|---|---|---|
| Motion forecasting baseline -> MTR | 多 agent 未来轨迹多模态,单纯回归容易平均化。 | 用 global intention localization + local movement refinement 的 motion query pair 表达多模态未来。 | 依赖 Waymo Motion schema,不是相机感知任务。 | 没有 Waymo Motion 时,不要用 nuScenes mini 强行替代。 |
| Imitation planner baseline -> PLUTO | nuPlan planning 中,普通 imitation planner 上限和工程细节未被充分打磨。 | 通过强 feature cache、scenario builder 和 planner simulation 推高 imitation planning 上限。 | 依赖 nuPlan、maps、cache 和 devkit 版本。 | 优先补 nuPlan mini/maps 做 sanity check。 |
| Prediction + planning -> DTPP | 预测与规划拆开会导致 ego 策略评估不充分。 | 将 joint conditional prediction 与 tree policy planning cost evaluation 结合。 | planner simulation 和 cost 设计版本敏感。 | 分三层验证:数据能读、模型能跑、planner 能被 simulation 调用。 |
6. NAVSIM、评分、扩散、RL 与 VLM 新趋势
Section titled “6. NAVSIM、评分、扩散、RL 与 VLM 新趋势”| 演进关系 | 上一步的问题 | 当前工作的优化点 | 新代价/风险 | 复现启发 |
|---|---|---|---|---|
| Direct regression planner -> DiffusionDrive | 规划天然多模态,直接回归容易保守或平均化。 | 用 truncated diffusion 表达多模态轨迹,同时控制采样步数以满足实时性。 | 依赖 NAVSIM,PDF 本地文本提取失败,需结合仓库文档复核。 | 不要用 nuScenes mini 替代 NAVSIM。 |
| DiffusionDrive -> DiffusionDriveV2 | diffusion 生成多样性与轨迹质量之间存在张力。 | 加入 RL-constrained truncated diffusion,用行为质量约束生成分布。 | RL 环境、reward、checkpoint 和评测版本都会影响结果。 | 先跑 checkpoint inference,再考虑小规模 RL 调试。 |
| Candidate planner -> GTRS | 生成候选轨迹不等于会选,评分器泛化性不足。 | 强调 generalized trajectory scoring,将候选覆盖和评分质量拆开优化。 | 候选 vocabulary/trajectory statistics 缺失时结果无意义。 | 与 SparseDriveV2 一起读,理解 scoring 范式。 |
| GTRS/SparseDrive -> SparseDriveV2 | 候选轨迹空间大,直接 scoring 容易计算膨胀。 | factorized trajectory vocabulary + factorized scoring。 | NAVSIM/Bench2Drive 体系与 nuScenes 端到端不同。 | 复现前先准备 NAVSIM 和轨迹词表。 |
| Offline imitation/RL baseline -> RAD | open-loop imitation 无法充分解决闭环分布偏移。 | 基于 3DGS 闭环环境做大规模 RL 训练 driving policy。 | 环境构建、reward hacking、训练成本很高。 | 当前本地数据只适合读代码和 demo,不适合完整复现。 |
| RAD -> RAD-2 | 单纯 RL 扩展到更大规模时,数据生成和策略评估不稳定。 | 引入 generator-discriminator framework 推进 RL scaling。 | 需要官方环境资产,否则从零复现成本极高。 | 放在长期研究项,不作为近期 smoke test。 |
| Traditional planner -> Senna | 传统端到端模型缺少语言层面的解释、推理和高层意图理解。 | 引入 VLM,把驾驶场景理解、问答、决策和规划联系起来。 | 大模型权重、QA 数据、显存和许可证是主要门槛。 | 5080 16GB 更适合量化 inference 或小 LoRA。 |
| Senna -> Senna-2 | VLM-driving 需要更大任务覆盖和更强推理/规划接口。 | 继续扩展 VLM-oriented driving reasoning 和数据/任务体系。 | prompt、conversation format、tokenizer、base model 版本都会影响可比性。 | 先跑官方 demo/checkpoint,再考虑数据转换。 |
这一段是 2024-2026 变化最快的区域。NAVSIM 提出 non-reactive simulation,用真实数据和短时 BEV abstraction unroll 在 open-loop 与 full closed-loop 之间折中,避免传统 L2/collision 无法反映闭环表现的问题。Bench2Drive 则强调 CARLA 中多能力闭环评测,后续 Bench2Drive-R 用生成模型把真实数据转成 reactive closed-loop benchmark,Bench2Drive-Robust 进一步评测 camera failure、ego-state noise 和 inference delay 等部署扰动。nuPlan-R 则尝试用学习式 reactive agents 替代规则 IDM agents,提高 nuPlan 闭环交互真实性。
世界模型路线也需要从“辅助数据生成”升级为“规划范式”。GAIA-1 将视频、文本和 action 作为 token 序列进行生成式世界建模;DriveDreamer 从真实驾驶数据建立世界模型并用于可控视频生成和驾驶策略,DriveDreamer-Policy 进一步把语言指令、多视角图像、depth/future video/action generation 统一到 world-action model;DriveGPT/DrivingGPT 将驾驶行为或图像-动作统一成 autoregressive sequence modeling;World4Drive 和 SparseWorld 则把 world model 直接接入 end-to-end planning,前者强调 perception annotation-free 的 latent world model,后者强调 sparse scene representation 下的未来实例预测。它们共同说明,未来技术路线可能不再只是在 planner head 上做文章,而是在“能否预测可控未来”上竞争。
VLM/LLM 路线也远不止 Senna。OpenDriveLab 论文集列出了 DriveLM、Reason2Drive、LMDrive、Agent-Driver、OmniDrive、DriveVLM 等一批工作。Agent-Driver 把 LLM 作为带工具库、记忆和推理引擎的 cognitive agent;DriveVLM 将场景描述、场景分析和分层规划结合;Senna 则明确将 LVLM 的高层语言决策与 E2E 模型的低层轨迹预测解耦。到 Senna-2 和 AppleVLM 这类 2026 工作,重点开始转向 VLM 高层决策与低层 E2E planning 的一致性、闭环对齐和 planning modality。
7. 一张复现导向的总图
Section titled “7. 一张复现导向的总图”2D Transformer Detection DETR -> Deformable DETR -> DETR3D -> PETR -> PETRv2 -> StreamPETR -> BEVFormer -> UniAD -> VAD -> SSR -> BEVFormer -> UniAD/SparseDrive -> CMT (camera-lidar fusion branch)
Sparse Temporal Perception Sparse4D -> Sparse4Dv2 -> Sparse4Dv3 -> SparseDrive -> SparseDriveV2
Prediction and Planning MTR PLUTO DTPP
New Planning Paradigms DiffusionDrive -> DiffusionDriveV2 GTRS -> SparseDriveV2 RAD -> RAD-2 Senna -> Senna-2
Benchmarks and Evaluation nuScenes open-loop -> nuPlan closed-loop -> NAVSIM non-reactive -> Bench2Drive closed-loop -> Bench2Drive-R / nuPlan-R reactive simulation -> Bench2Drive-Robust deployment perturbations
World Models and Foundation Models GAIA-1 / DriveDreamer -> DriveDreamer-Policy / DrivingGPT / DriveGPT -> World4Drive / SparseWorld DriveLM / Agent-Driver / DriveVLM -> Senna -> Senna-2 / AppleVLM如果目标是本地复现,推荐按“工程可控性”而不是“论文名气”排序:
mmdetection3d+ KITTI 验证环境。- DETR3D/PETR/Sparse4D 用 nuScenes mini 验证多相机 query 和坐标链路。
- BEVFormer/VAD/SSR 在补 CAN bus 后验证 temporal/planning 数据链路。
- SparseDrive/UniAD 放到对 Sparse4D/BEVFormer 已熟悉之后。
- NAVSIM、nuPlan、Waymo、VLM/RL 系列单独补数据和权重,不用 KITTI/nuScenes mini 硬改。
8. 未纳入当前复现仓库、但值得继续跟踪的项目
Section titled “8. 未纳入当前复现仓库、但值得继续跟踪的项目”| 方向 | 代表工作 | 为什么重要 | 是否建议立刻 clone |
|---|---|---|---|
| DETR 基础改进 | DAB-DETR、DINO | 解释 3D query、anchor refinement、denoising training 的上游来源。 | 暂不需要;作为理论背景即可。 |
| LSS/depth BEV | BEVDet、BEVDepth | 从显式深度和 view transformation 推动 camera-only BEV 感知。 | 可后续补;对理解 BEVFormer 是重要对照。 |
| 多传感器 BEV fusion | BEVFusion | 说明 camera/LiDAR 可以在 BEV 空间统一,而不只在点级融合。 | 若计划研究 CMT/fusion,建议补。 |
| 高性能稀疏检测 | SparseBEV、Far3D | 是 Sparse4D/SparseDrive 之外的 sparse/query 视觉 3D 检测强支线。 | 建议后续补 SparseBEV 或 Far3D。 |
| CARLA 闭环 E2E | TransFuser、InterFuser、ThinkTwice、ReasonNet | 早期闭环和多模态融合路线,与 nuScenes open-loop 路线互补。 | 若准备 CARLA/Bench2Drive,再补。 |
| 生成式端到端 | GenAD、World4Drive、SparseWorld | 从“预测轨迹”转向“预测未来场景/潜空间演化”。 | 建议优先补 GenAD 或 SparseWorld 之一。 |
| VLM/LLM driving | DriveLM、Agent-Driver、DriveVLM、OmniDrive、AppleVLM | 解释 Senna/Senna-2 的上下游位置。 | 先读论文;真正复现需要大模型权重和数据。 |
| 新评测协议 | NAVSIM、Bench2Drive、Bench2Drive-R、nuPlan-R | 决定规划论文指标是否可信、是否接近闭环部署。 | NAVSIM 优先级最高,Bench2Drive 次之。 |
9. 本次联网调研的主要来源
Section titled “9. 本次联网调研的主要来源”- DETR: https://arxiv.org/abs/2005.12872
- Deformable DETR: https://arxiv.org/abs/2010.04159
- DAB-DETR: https://arxiv.org/abs/2201.12329
- DINO: https://arxiv.org/abs/2203.03605
- BEVFormer / BEVFormer v2: https://arxiv.org/abs/2203.17270, https://arxiv.org/abs/2211.10439
- BEVDepth / BEVFusion: https://arxiv.org/abs/2206.10092, https://arxiv.org/abs/2205.13542
- SparseBEV / Far3D: https://arxiv.org/abs/2308.09244, https://arxiv.org/abs/2308.09616
- UniAD / VAD / SparseDrive / SSR: https://arxiv.org/abs/2212.10156, https://arxiv.org/abs/2303.12077, https://arxiv.org/abs/2405.19620, https://arxiv.org/abs/2409.18341
- GenAD: https://arxiv.org/abs/2402.11502
- MTR / MTR++ / PLUTO / DTPP: https://arxiv.org/abs/2209.13508, https://arxiv.org/abs/2306.17770, https://arxiv.org/abs/2404.14327, https://arxiv.org/abs/2310.05885
- NAVSIM / Bench2Drive / Bench2Drive-R / Bench2Drive-Robust / nuPlan-R: https://arxiv.org/abs/2406.15349, https://arxiv.org/abs/2406.03877, https://arxiv.org/abs/2412.09647, https://arxiv.org/abs/2605.18059, https://arxiv.org/abs/2511.10403
- DiffusionDrive / GTRS / SparseDriveV2 / DiffusionDriveV2 / RAD / RAD-2 / Senna / Senna-2: https://arxiv.org/abs/2411.15139, https://arxiv.org/abs/2506.06664, https://arxiv.org/abs/2603.29163, https://arxiv.org/abs/2512.07745, https://arxiv.org/abs/2502.13144, https://arxiv.org/abs/2604.15308, https://arxiv.org/abs/2410.22313, https://arxiv.org/abs/2603.11219
- OpenDriveLab End-to-end Autonomous Driving survey/repository: https://arxiv.org/abs/2306.16927, https://github.com/OpenDriveLab/End-to-end-Autonomous-Driving
- GAIA-1 / DriveDreamer / DriveDreamer-Policy / DriveGPT / DrivingGPT / World4Drive / SparseWorld: https://arxiv.org/abs/2309.17080, https://arxiv.org/abs/2309.09777, https://arxiv.org/abs/2604.01765, https://arxiv.org/abs/2412.14415, https://arxiv.org/abs/2412.18607, https://arxiv.org/abs/2507.00603, https://arxiv.org/abs/2605.24354
- DriveVLM / Agent-Driver / AppleVLM: https://arxiv.org/abs/2402.12289, https://arxiv.org/abs/2311.10813, https://arxiv.org/abs/2602.04256