跳转到内容

自动驾驶数据集、基准与评测

nuScenes、Waymo 等数据集与开环/闭环评测基准。

类型 Topics · 更新 2026-07-19

本Topic聚焦自动驾驶系统研发中的核心瓶颈:如何构建可信、可复现、能区分真实能力的数据集与评测协议。现有公开数据多偏简单场景、低密度、白天城市场景,导致模型在高遮挡、夜间、远距离、恶劣天气或交互密集场景中表现骤降;同时开环指标(如检测mAP、轨迹ADE)与闭环驾驶安全/舒适性相关性弱,仿真与真实差距大,协议不统一使论文结果难比较。目标是梳理从KITTI/nuScenes/Waymo等基础多模态感知数据集,到Argoverse/nuPlan等预测规划数据,再到NAVSIM、DriveE2E、nuPlan-R、CLOVER等闭环基准的演进,明确有效证据的定义方式,指导研究者选择/构建数据、设计评测,避免虚假进步,支撑安全可靠的端到端与模块化系统迭代。

  • 详细推导具体检测/规划网络架构与损失函数
  • 提供完整数据标注流水线实现代码或工具链
  • 覆盖非自动驾驶领域的通用计算机视觉基准
  • 深入讨论硬件传感器标定细节或车辆动力学建模
  • foundations — 需掌握基本传感器模态(相机/LiDAR/雷达)、3D检测与BEV表示、开环vs闭环评测直觉,才能理解数据集覆盖与协议设计取舍
  • autonomous-driving — 了解感知-预测-规划流水线与端到端范式,便于将数据集/基准映射到系统组件
术语 含义 常见混淆
开环评测 给定历史观测与专家轨迹,模型输出预测/规划后直接与真值比较(如ADE/FDE、mAP),不反馈到环境 常被误认为能代表真实驾驶能力,实际与闭环碰撞率/进度相关性待核验
闭环评测 模型输出控制/轨迹后,环境(仿真或实车)状态更新并反馈新观测,持续交互评估安全与任务完成 易与开环混淆;仿真闭环仍受domain gap影响,需真实-仿真桥接
nuScenes 2019多模态(相机+LiDAR+雷达)自动驾驶数据集,含3D检测、跟踪、预测任务与官方评测协议,业界基础基准之一 与KITTI/Waymo规模与场景分布不同,直接跨数据集对比需注意协议差异
NAVSIM 面向端到端规划的闭环/仿真评测框架,强调导航仿真与真实数据结合,用于检验开环指标预测闭环驾驶能力 名称易与nuScenes混淆;重点在协议与相关性研究而非单纯数据发布
多模态数据集 同步采集并标定多种传感器(RGB、LiDAR点云、雷达、地图等)的时序数据,支持融合感知与规划 标注范围、传感器冗余、天气/时间多样性常被忽视,导致鲁棒性假象
协议论文 定义有效证据标准、评测指标、基线与提交规则的工作,使不同方法可公平比较 仅发数据而无严格协议会导致不可复现结果泛滥

早期以KITTI等小规模开环感知基准为主,强调3D检测精度。nuScenes与Waymo Open Dataset引入大规模多模态与多样场景,推动融合与跟踪。随后Argoverse/nuPlan转向交互预测与规划数据。近期DriveE2E、nuPlan-R、CLOVER、NAVSIM相关性研究强调闭环仿真、反应式多智能体、真实到仿真桥接与价值估计,从“指标好看”转向“可验证安全驾驶能力”,协议本身成为核心贡献。

  1. nuScenes: A Multimodal Dataset for Autonomous Driving(精读)— 奠定多模态感知基准与官方协议,后续几乎所有AD数据集与评测均参考其覆盖与任务定义,是理解基础证据标准的必读
  2. Scalability in Perception for Autonomous Driving: Waymo Open Dataset(精读)— 展示工业级大规模感知数据与可扩展评测,补充nuScenes场景分布,是大规模基准设计范例
  3. A*3D Dataset: Towards Autonomous Driving in Challenging Environments(中文笔记)— 针对高密度、重遮挡、夜间等挑战场景补充现有数据不足,有中文笔记辅助,揭示简单基准的局限
  1. 先读nuScenes与Waymo Open Dataset理解多模态感知数据集标准构成、任务与协议
  2. 对照A*3D与aiMotive等补充挑战/长距离/雷达冗余覆盖,识别现有数据缺口
  3. 阅读Argoverse 2与Waymo Open Motion Dataset转向预测/运动预测数据
  4. 研读DriveE2E、nuPlan-R、CLOVER与开闭环相关性论文(NAVSIM-Bench2Drive),掌握闭环协议设计与证据有效性
  5. 最后浏览Creating Impactful…与协同感知/survey类,形成从数据到基准的构建方法论
Paper 输入 输出 表示 训练目标
nuScenes: A Multimodal Dataset for Autonomous Driving 多传感器同步帧(相机/LiDAR/雷达)与标注 3D检测/跟踪/预测结果与官方指标 时序多模态点云/图像+地图 建立可复现感知基准协议
Scalability in Perception for Autonomous Driving: Waymo Open Dataset 大规模多样场景多传感器数据 感知任务评测结果 验证大规模数据与可扩展评测对感知鲁棒性
A*3D Dataset: Towards Autonomous Driving in Challenging Environments 新加坡高多样性RGB-LiDAR挑战场景 3D目标检测基准 多帧多模态点云/图像 暴露并改进复杂环境检测性能
DriveE2E: Closed-Loop Benchmark for End-to-End Autonomous Driving through Real-to-Simulation 真实数据驱动的仿真闭环 端到端驾驶闭环指标 桥接真实到仿真的闭环评测
Do Open-Loop Metrics Predict Closed-Loop Driving? A Cross-Benchmark Correlation Study of NAVSIM and Bench2Drive 开环预测/规划输出 与闭环驾驶表现相关性分析 检验开环指标对闭环能力的预测力
  • 开环指标虚高而闭环碰撞/进度差,导致错误选型与部署风险
  • 数据集场景分布偏差(城市白天为主)造成长尾失效与安全隐患
  • 仿真闭环domain gap使结果不可迁移真实道路
  • 协议不统一、标注噪声与同步误差导致不可复现与虚假SOTA
  • 缺乏传感器冗余/远距/恶劣天气覆盖使鲁棒性被高估
  • 开环指标与真实闭环安全/舒适性的定量相关性边界在哪里?
  • 如何系统性设计真实-仿真桥接协议以最小化domain gap?
  • 多智能体反应式仿真(如nuPlan-R)对规划泛化的实际增益待核验
  • 构建“有影响力”数据集的可操作战略框架如何落地并避免冗余发布?
  • 协同感知与多车数据集在闭环评测中的标准协议尚缺
  1. 为什么仅依赖开环mAP/ADE不足以证明自动驾驶规划能力?结合NAVSIM相关研究说明
  2. 对比nuScenes与A*3D,后者在场景覆盖上主要补充了哪些挑战因素?
  3. 闭环评测中“反应式多智能体仿真”相比静态专家回放的核心优势是什么?
  4. 协议论文在自动驾驶基准中的作用为何比单纯数据发布更关键?
  5. 列举至少两种导致数据集“看起来大但用处有限”的常见设计缺陷

本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
foundational A*3D Dataset: Towards Autonomous Driving in Challenging Environments 2019 A*3D Dataset foundational challenging environments
watch aiMotive Dataset: A Multimodal Dataset for Robust Autonomous Driving with Long-Range Perception 2022 coverage fill ad-datasets-benchmarks->watch keyword
watch Collaborative Perception in Autonomous Driving: Methods, Datasets and Challenges 2023 auto score=38
watch CogAD: Cognitive-Hierarchy Guided End-to-End Autonomous Driving 2025 auto refresh 2026-07-18 sources=arxiv
recent DriveE2E: Closed-Loop Benchmark for End-to-End Autonomous Driving through Real-to-Simulation 2025 auto refresh 2026-07-19 sources=arxiv
recent nuPlan-R: A Closed-Loop Planning Benchmark for Autonomous Driving via Reactive Multi-Agent Simulation 2025 auto refresh 2026-07-19 sources=arxiv,openalex
watch DrivIng: A Large-Scale Multimodal Driving Dataset with Full Digital Twin Integration 2026 auto refresh 2026-07-19 sources=arxiv
watch TaCarla: A comprehensive benchmarking dataset for end-to-end autonomous driving 2026 auto score=45
recent Do Open-Loop Metrics Predict Closed-Loop Driving? A Cross-Benchmark Correlation Study of NAVSIM and Bench2Drive 2026 auto refresh 2026-07-19 sources=arxiv,openalex
recent CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning 2026 auto refresh 2026-07-19 sources=arxiv
watch Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark 2026 auto score=43
watch Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset 2021 cross-topic assign from registry title match=2 keywords; 202
watch A Survey on Multimodal Large Language Models for Autonomous Driving 2024 auto refresh 2026-07-19 sources=openalex
foundational Scalability in Perception for Autonomous Driving: Waymo Open Dataset 2019 Waymo Open Dataset — large-scale perception benchmark; indus
recent Argoverse 2: Next Generation Datasets for Self-Driving Perception and\n Forecasting 2023 Argoverse 2 — next-gen perception+forecasting datasets widel
foundational nuScenes: A Multimodal Dataset for Autonomous Driving 2019 nuScenes CVPR 2020 foundational AD dataset

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)

Section titled “基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)”

近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)

Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”

观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)

Section titled “观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)”

成熟度 seed · 内容数 19 · 论文池 16