跳转到内容

nuScenes: A Multimodal Dataset for Autonomous Driving

学习档位 精读

类型 文献 · 更新 2026-07-14

标签 autonomous-driving · nuscenes

所属 自动驾驶数据集、基准与评测 · 数据工程与数据闭环

nuScenes 试图为自动驾驶研究提供覆盖 360 度的相机、雷达和 LiDAR 数据,并以统一场景、标注、地图和评测协议支持 3D 检测与跟踪研究。[@caesar2020nuscenes]

  • 采集平台包含 6 个相机、5 个雷达和 1 个 LiDAR;论文报告相机、雷达和 LiDAR 的采集频率分别为 12 Hz、13 Hz 和 20 Hz。
  • 数据集选取 1000 个约 20 秒场景,在 2 Hz keyframe 上标注 23 个对象类别和 8 个属性,同时发布 keyframe 之间的传感器帧。
  • 论文描述 4 个采集区域、原始栅格语义地图和包含 11 个语义层的矢量地图扩展,并说明发布原始 CAN bus 数据。
  • 23 类是采集标注 taxonomy;检测和跟踪 benchmark 会进行类别合并与过滤,不能把 23 类直接当作检测类别数。
结论 位置
传感器配置、1000 个场景、20 秒、23 类和 8 个属性 PDF p.1, Abstract
数据集规模、任务与标注频率对比 PDF p.3, Table 1
传感器规格与频率 PDF p.4, Table 2
场景选择、2 Hz keyframe 标注和中间传感器帧 PDF p.4, Dataset collection and annotation
栅格地图、矢量地图扩展和 CAN bus PDF p.4, Map and vehicle data
taxonomy 到检测/跟踪类别的合并 PDF p.12, Supplementary material
  • 论文描述数据集目标、采集和评测,不是 JSON 字段级 schema 的完整规范;字段关系还需结合官方 devkit 与实际数据包验证。
  • nuScenes 是离线数据集,不提供可交互闭环环境,不能单独验证控制器、安全降级或真实闭环驾驶能力。
  • mini 版本适合检查读取、坐标变换和模型链路,不适合作为论文指标复现证据。
  • topic: ad-datasets-benchmarks
  • sources: asta, semantic-scholar-http
  • retrieved_at: 2026-07-20
  • query: Find foundational and recent research papers for the topic «数据集与评测» (ad-datasets-benchmarks). Prefer peer-reviewed or widely cited work with clear method contributions. Include open-source code when available. Exclude pure survey spam unless highly cited. Core concepts: autonomous driving dataset, benchmark protocol, closed-loop evaluation, NAVSIM, nuScenes. Search facets: autonomous driving dataset benchmark protocol; closed-loop planning evaluation NAVSIM nuPlan; multimodal autonomous driving
  • corpus_id: 85517967
  • arxiv: 1903.11027
  • doi: 10.1109/cvpr42600.2020.01164
  • relevance_score: 0.8269916616033898
  • score_total: 76
  • suggested_tier: foundational

(no prose relevance explanation — numeric score only or HTTP source)

(no snippet evidence in candidate pool)

中文学习笔记(自动生成,需核验)

Section titled “中文学习笔记(自动生成,需核验)”

Topic: ad-datasets-benchmarks · Tier: foundational · Year: 2019 · Venue:
Evidence level: partial · 本地全文: 是 · 建议阅读: ~40 分钟
Paper: https://arxiv.org/abs/1903.11027
Code:
Generator: grok

这是首个提供完整自动驾驶传感器套件(6相机+5雷达+1激光雷达,全360°覆盖)的大规模多模态数据集,含夜间/雨天等挑战场景、属性标注与语义地图,并定义了面向AV的3D检测与跟踪新指标,对多传感器融合、长尾检测与场景理解研究具有奠基作用。

nuScenes是首个全传感器套件、含雷达与属性标注的大规模多模态自动驾驶数据集(1000个20s场景),并定义了基于中心距离的3D检测/跟踪指标与基线。

现有图像数据集驱动了2D检测/跟踪/分割,但AV依赖相机+激光雷达+雷达等多传感器;缺乏覆盖全套传感器、360°视野、困难条件(夜间/雨天)、属性标注与语义地图的大规模多模态数据集,难以训练与评估鲁棒的3D检测与跟踪方法。

自动驾驶感知基础、3D目标检测与多目标跟踪、多模态传感器(相机/激光雷达/雷达)特性与融合、KITTI等早期数据集、IoU与mAP等评估概念、语义地图与定位。

  • 发布nuScenes:首个全AV传感器套件(6相机、5雷达、1激光雷达,360°FOV)、含雷达数据、夜间/雨天条件、物体属性与场景描述的大规模多模态数据集(1000场景×20s,23类+8属性3D框,标注量约为KITTI的7倍、图像量100倍)。
  • 定义面向AV应用的新型3D检测与跟踪指标(基于2D中心距离匹配的mAP与真阳性误差指标)。
  • 提供激光雷达与图像检测/跟踪基线(含多激光雷达扫描增强方法),以及devkit、评估代码、分类体系、标注说明与数据库schema,促进标准化(后被Lyft L5等采用)。

规划多样驾驶路线并采集原始传感器数据→使用蒙特卡洛定位(激光雷达+里程计+离线HD地图)实现高精度定位(误差≤10cm)与运动补偿→人工筛选1000个有趣20s场景→以2Hz采样关键帧并全量标注23类3D框(含属性与场景描述)→发布中间帧、语义地图(11层)与baseline(检测/跟踪)→用新指标评估并举办挑战赛。

传感器同步:相机曝光由激光雷达扫描触发中心FOV,实现跨模态对齐;定位:离线激光雷达HD地图+在线蒙特卡洛方案,替代脆弱GPS/IMU;标注:关键帧2Hz连续3D框(至少1个激光/雷达点即可),含可见性/活动/姿态属性;指标设计取舍:用地面2D中心距离d匹配替代IoU,以解耦尺寸/朝向并利于小目标与视觉方法比较;mAP在D={0.5,1,2,4}m阈值上平均,并过滤低精度/召回噪声;TP指标在d=2m下计算原生单位误差(ATE/ASE等);场景筛选强调高密度、罕见类、危险情况与多样性。

数据集:nuScenes(波士顿与新加坡,1000场景共约5.5小时,1.4M图像、400k激光雷达点云、1.3M雷达点云、40k关键帧、1.4M 3D框,23类,11语义地图层);传感器细节见表2(相机12Hz 1600×900,激光雷达32线20Hz≤70m,雷达≤250m 13Hz);条件分布:雨19.4%、夜11.6%;指标:检测mAP(中心距离匹配,召回/精度>10%区域AUC平均,再对类与D阈值平均)+TP误差(ATE欧氏中心距离、ASE对齐后3D IoU等,d=2m匹配);跟踪指标(摘录提及但细节有限);与KITTI/H3D/Waymo等比较见表1。

提供激光雷达与图像检测/跟踪基线(含多激光雷达扫描增强);检测挑战使激光雷达与相机方法相对初始SOTA分别提升40%与81%(Table 4提及);数据集被广泛采用于检测、预测、融合等任务;具体数值与完整表格待来源核验。

类极度不平衡(最少与最多类标注比1:10k,远超KITTI的1:36),鼓励长尾研究但增加训练难度;关键帧2Hz(中间帧可用),定位依赖地图;适用边界为城市复杂场景与多模态融合,极端天气/全新国家/未见物体泛化仍需进一步研究;雷达数据稀疏定位精度较低;摘录未详述失败案例。

与前序 / 同期 / 后续方法的关系

Section titled “与前序 / 同期 / 后续方法的关系”

前序:KITTI(开创多模态但仅前视、无雷达、无夜间/雨、规模小);CamVid/Cityscapes/BDD等图像为主;H3D/KAIST等有限多模态。同期/后续:Waymo Open(标注更多但频率更高、无雷达)、Argoverse、Lyft L5(采用nuScenes schema兼容)、A*3D/A2D2等;nuScenes推动后续融合、预测与扩展标注工作,并仍为唯一提供标注雷达的主要AV数据集之一。

官方:nuscenes.org 与 github.com/nutonomy/nuscenes-devkit(含devkit、评估代码、taxonomy、schema);数据CC BY-NC-SA 4.0非商业;建议用devkit加载场景/标注/地图,运行官方评估与baseline,注意传感器时间戳对齐与多扫描点云处理。

先读Abstract与1.1 Contributions建立全局→Table 1与1.2 Related datasets对比→Section 2数据集构建细节(传感器/定位/标注/统计)→指标定义(中心距离mAP与TP)→基线与挑战结果(若完整版有)→最后看Figure与补充材料统计图。

  1. Q: nuScenes相比KITTI的主要规模优势是什么? A: 约7倍标注量与100倍图像量;首个全传感器套件含雷达与360°覆盖,并含夜间/雨天与属性。
  2. Q: 为什么检测匹配使用2D中心距离而非IoU? A: 解耦尺寸与朝向影响,并避免小足迹目标(行人/自行车)因小平移导致IoU=0,便于比较视觉方法。
  3. Q: 数据集采集地与传感器配置? A: 波士顿与新加坡;6相机(12Hz)、1激光雷达(32线20Hz)、5雷达(13Hz)、GPS/IMU,全360°。
  4. Q: 标注关键帧频率与包含内容? A: 2Hz关键帧;23类3D框(x,y,z,w,l,h,yaw)+属性(可见性、活动、姿态)+场景文本描述;另有中间帧与11层语义地图。
  5. Q: mAP如何计算? A: 对每个类与匹配阈值d∈{0.5,1,2,4}m,计算召回/精度>10%区域的归一化PR曲线下面积,再对类与阈值平均;低性能类AP置0。
  • Abstract (page 1): nuScenes comprises 1000 scenes, each 20s long and fully annotated with 3D bounding boxes for 23 classes and 8 attributes. It has 7x as many annotations and 100x as many images as the pioneering KITTI dataset. We define novel 3D detection and tracking metrics.
  • Abstract / Introduction (page 1): the first dataset to carry the full autonomous vehicle sensor suite: 6 cameras, 5 radars and 1 lidar, all with full 360 degree field of view.
  • 1.1 Contributions (page 2): nuScenes represents a large leap forward in terms of data volumes and complexities (Table 1), and is the first dataset to provide 360◦ sensor coverage from the entire sensor suite. It is also the first AV dataset to include radar data… nighttime and rainy conditions, and with object attributes and scene descriptions
  • Section 2 / Metrics (page 5): the 2D center distance d on the ground plane instead of intersection over union (IOU)… We then average over matching thresholds of D = {0.5, 1, 2, 4} meters… mAP = 1/|C||D| ∑∑ APc,d
  • Annotation statistics (page 5): the dataset shows severe class imbalance with a ratio of 1:10k for the least and most common class annotations (1:36 in KITTI).
flowchart LR
A["输入 / 观测"] --> B["表示 / 编码"]
B --> C["推理 / 解码"]
C --> D["输出 / 动作或检测"]
%% method sketch for: nuScenes: A Multimodal Dataset for Autonomous Driving

方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。

nuScenes: A Multimodal Dataset for Autonomous Driving arch p.1

来源:原论文约 p.1(arch);学习用途摘录。

nuScenes: A Multimodal Dataset for Autonomous Driving table p.2

来源:原论文约 p.2(table);学习用途摘录。