nuScenes: A Multimodal Dataset for Autonomous Driving
nuScenes
Section titled “nuScenes”学习档位 精读
类型 文献 · 更新 2026-07-14
标签 autonomous-driving · nuscenes
所属 自动驾驶数据集、基准与评测 · 数据工程与数据闭环
这篇文献回答什么问题
Section titled “这篇文献回答什么问题”nuScenes 试图为自动驾驶研究提供覆盖 360 度的相机、雷达和 LiDAR 数据,并以统一场景、标注、地图和评测协议支持 3D 检测与跟踪研究。[@caesar2020nuscenes]
- 采集平台包含 6 个相机、5 个雷达和 1 个 LiDAR;论文报告相机、雷达和 LiDAR 的采集频率分别为 12 Hz、13 Hz 和 20 Hz。
- 数据集选取 1000 个约 20 秒场景,在 2 Hz keyframe 上标注 23 个对象类别和 8 个属性,同时发布 keyframe 之间的传感器帧。
- 论文描述 4 个采集区域、原始栅格语义地图和包含 11 个语义层的矢量地图扩展,并说明发布原始 CAN bus 数据。
- 23 类是采集标注 taxonomy;检测和跟踪 benchmark 会进行类别合并与过滤,不能把 23 类直接当作检测类别数。
| 结论 | 位置 |
|---|---|
| 传感器配置、1000 个场景、20 秒、23 类和 8 个属性 | PDF p.1, Abstract |
| 数据集规模、任务与标注频率对比 | PDF p.3, Table 1 |
| 传感器规格与频率 | PDF p.4, Table 2 |
| 场景选择、2 Hz keyframe 标注和中间传感器帧 | PDF p.4, Dataset collection and annotation |
| 栅格地图、矢量地图扩展和 CAN bus | PDF p.4, Map and vehicle data |
| taxonomy 到检测/跟踪类别的合并 | PDF p.12, Supplementary material |
- 论文描述数据集目标、采集和评测,不是 JSON 字段级 schema 的完整规范;字段关系还需结合官方 devkit 与实际数据包验证。
- nuScenes 是离线数据集,不提供可交互闭环环境,不能单独验证控制器、安全降级或真实闭环驾驶能力。
- mini 版本适合检查读取、坐标变换和模型链路,不适合作为论文指标复现证据。
- nuScenes 数据模型
- 本机 nuScenes mini 指南(内部项目资料)
Discovery evidence
Section titled “Discovery evidence”- topic:
ad-datasets-benchmarks - sources:
asta,semantic-scholar-http - retrieved_at: 2026-07-20
- query: Find foundational and recent research papers for the topic «数据集与评测» (ad-datasets-benchmarks). Prefer peer-reviewed or widely cited work with clear method contributions. Include open-source code when available. Exclude pure survey spam unless highly cited. Core concepts: autonomous driving dataset, benchmark protocol, closed-loop evaluation, NAVSIM, nuScenes. Search facets: autonomous driving dataset benchmark protocol; closed-loop planning evaluation NAVSIM nuPlan; multimodal autonomous driving
- corpus_id:
85517967 - arxiv:
1903.11027 - doi:
10.1109/cvpr42600.2020.01164 - relevance_score:
0.8269916616033898 - score_total: 76
- suggested_tier:
foundational
Relevance
Section titled “Relevance”(no prose relevance explanation — numeric score only or HTTP source)
Snippets
Section titled “Snippets”(no snippet evidence in candidate pool)
中文学习笔记(自动生成,需核验)
Section titled “中文学习笔记(自动生成,需核验)”Topic: ad-datasets-benchmarks · Tier: foundational · Year: 2019 · Venue: —
Evidence level: partial · 本地全文: 是 · 建议阅读: ~40 分钟
Paper: https://arxiv.org/abs/1903.11027
Code: —
Generator: grok
为什么值得读
Section titled “为什么值得读”这是首个提供完整自动驾驶传感器套件(6相机+5雷达+1激光雷达,全360°覆盖)的大规模多模态数据集,含夜间/雨天等挑战场景、属性标注与语义地图,并定义了面向AV的3D检测与跟踪新指标,对多传感器融合、长尾检测与场景理解研究具有奠基作用。
nuScenes是首个全传感器套件、含雷达与属性标注的大规模多模态自动驾驶数据集(1000个20s场景),并定义了基于中心距离的3D检测/跟踪指标与基线。
现有图像数据集驱动了2D检测/跟踪/分割,但AV依赖相机+激光雷达+雷达等多传感器;缺乏覆盖全套传感器、360°视野、困难条件(夜间/雨天)、属性标注与语义地图的大规模多模态数据集,难以训练与评估鲁棒的3D检测与跟踪方法。
自动驾驶感知基础、3D目标检测与多目标跟踪、多模态传感器(相机/激光雷达/雷达)特性与融合、KITTI等早期数据集、IoU与mAP等评估概念、语义地图与定位。
- 发布nuScenes:首个全AV传感器套件(6相机、5雷达、1激光雷达,360°FOV)、含雷达数据、夜间/雨天条件、物体属性与场景描述的大规模多模态数据集(1000场景×20s,23类+8属性3D框,标注量约为KITTI的7倍、图像量100倍)。
- 定义面向AV应用的新型3D检测与跟踪指标(基于2D中心距离匹配的mAP与真阳性误差指标)。
- 提供激光雷达与图像检测/跟踪基线(含多激光雷达扫描增强方法),以及devkit、评估代码、分类体系、标注说明与数据库schema,促进标准化(后被Lyft L5等采用)。
规划多样驾驶路线并采集原始传感器数据→使用蒙特卡洛定位(激光雷达+里程计+离线HD地图)实现高精度定位(误差≤10cm)与运动补偿→人工筛选1000个有趣20s场景→以2Hz采样关键帧并全量标注23类3D框(含属性与场景描述)→发布中间帧、语义地图(11层)与baseline(检测/跟踪)→用新指标评估并举办挑战赛。
关键模块和设计取舍
Section titled “关键模块和设计取舍”传感器同步:相机曝光由激光雷达扫描触发中心FOV,实现跨模态对齐;定位:离线激光雷达HD地图+在线蒙特卡洛方案,替代脆弱GPS/IMU;标注:关键帧2Hz连续3D框(至少1个激光/雷达点即可),含可见性/活动/姿态属性;指标设计取舍:用地面2D中心距离d匹配替代IoU,以解耦尺寸/朝向并利于小目标与视觉方法比较;mAP在D={0.5,1,2,4}m阈值上平均,并过滤低精度/召回噪声;TP指标在d=2m下计算原生单位误差(ATE/ASE等);场景筛选强调高密度、罕见类、危险情况与多样性。
数据集、实验设置与指标
Section titled “数据集、实验设置与指标”数据集:nuScenes(波士顿与新加坡,1000场景共约5.5小时,1.4M图像、400k激光雷达点云、1.3M雷达点云、40k关键帧、1.4M 3D框,23类,11语义地图层);传感器细节见表2(相机12Hz 1600×900,激光雷达32线20Hz≤70m,雷达≤250m 13Hz);条件分布:雨19.4%、夜11.6%;指标:检测mAP(中心距离匹配,召回/精度>10%区域AUC平均,再对类与D阈值平均)+TP误差(ATE欧氏中心距离、ASE对齐后3D IoU等,d=2m匹配);跟踪指标(摘录提及但细节有限);与KITTI/H3D/Waymo等比较见表1。
主要结果(需原文证据)
Section titled “主要结果(需原文证据)”提供激光雷达与图像检测/跟踪基线(含多激光雷达扫描增强);检测挑战使激光雷达与相机方法相对初始SOTA分别提升40%与81%(Table 4提及);数据集被广泛采用于检测、预测、融合等任务;具体数值与完整表格待来源核验。
局限、失败场景与适用边界
Section titled “局限、失败场景与适用边界”类极度不平衡(最少与最多类标注比1:10k,远超KITTI的1:36),鼓励长尾研究但增加训练难度;关键帧2Hz(中间帧可用),定位依赖地图;适用边界为城市复杂场景与多模态融合,极端天气/全新国家/未见物体泛化仍需进一步研究;雷达数据稀疏定位精度较低;摘录未详述失败案例。
与前序 / 同期 / 后续方法的关系
Section titled “与前序 / 同期 / 后续方法的关系”前序:KITTI(开创多模态但仅前视、无雷达、无夜间/雨、规模小);CamVid/Cityscapes/BDD等图像为主;H3D/KAIST等有限多模态。同期/后续:Waymo Open(标注更多但频率更高、无雷达)、Argoverse、Lyft L5(采用nuScenes schema兼容)、A*3D/A2D2等;nuScenes推动后续融合、预测与扩展标注工作,并仍为唯一提供标注雷达的主要AV数据集之一。
官方代码与复现建议
Section titled “官方代码与复现建议”官方:nuscenes.org 与 github.com/nutonomy/nuscenes-devkit(含devkit、评估代码、taxonomy、schema);数据CC BY-NC-SA 4.0非商业;建议用devkit加载场景/标注/地图,运行官方评估与baseline,注意传感器时间戳对齐与多扫描点云处理。
推荐阅读顺序
Section titled “推荐阅读顺序”先读Abstract与1.1 Contributions建立全局→Table 1与1.2 Related datasets对比→Section 2数据集构建细节(传感器/定位/标注/统计)→指标定义(中心距离mAP与TP)→基线与挑战结果(若完整版有)→最后看Figure与补充材料统计图。
- Q: nuScenes相比KITTI的主要规模优势是什么? A: 约7倍标注量与100倍图像量;首个全传感器套件含雷达与360°覆盖,并含夜间/雨天与属性。
- Q: 为什么检测匹配使用2D中心距离而非IoU? A: 解耦尺寸与朝向影响,并避免小足迹目标(行人/自行车)因小平移导致IoU=0,便于比较视觉方法。
- Q: 数据集采集地与传感器配置? A: 波士顿与新加坡;6相机(12Hz)、1激光雷达(32线20Hz)、5雷达(13Hz)、GPS/IMU,全360°。
- Q: 标注关键帧频率与包含内容? A: 2Hz关键帧;23类3D框(x,y,z,w,l,h,yaw)+属性(可见性、活动、姿态)+场景文本描述;另有中间帧与11层语义地图。
- Q: mAP如何计算? A: 对每个类与匹配阈值d∈{0.5,1,2,4}m,计算召回/精度>10%区域的归一化PR曲线下面积,再对类与阈值平均;低性能类AP置0。
- Abstract (page 1): nuScenes comprises 1000 scenes, each 20s long and fully annotated with 3D bounding boxes for 23 classes and 8 attributes. It has 7x as many annotations and 100x as many images as the pioneering KITTI dataset. We define novel 3D detection and tracking metrics.
- Abstract / Introduction (page 1): the first dataset to carry the full autonomous vehicle sensor suite: 6 cameras, 5 radars and 1 lidar, all with full 360 degree field of view.
- 1.1 Contributions (page 2): nuScenes represents a large leap forward in terms of data volumes and complexities (Table 1), and is the first dataset to provide 360◦ sensor coverage from the entire sensor suite. It is also the first AV dataset to include radar data… nighttime and rainy conditions, and with object attributes and scene descriptions
- Section 2 / Metrics (page 5): the 2D center distance d on the ground plane instead of intersection over union (IOU)… We then average over matching thresholds of D = {0.5, 1, 2, 4} meters… mAP = 1/|C||D| ∑∑ APc,d
- Annotation statistics (page 5): the dataset shows severe class imbalance with a ratio of 1:10k for the least and most common class annotations (1:36 in KITTI).
方法结构(重绘)
Section titled “方法结构(重绘)”flowchart LR A["输入 / 观测"] --> B["表示 / 编码"] B --> C["推理 / 解码"] C --> D["输出 / 动作或检测"] %% method sketch for: nuScenes: A Multimodal Dataset for Autonomous Driving方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。
论文摘录图/表
Section titled “论文摘录图/表”
来源:原论文约 p.1(arch);学习用途摘录。

来源:原论文约 p.2(table);学习用途摘录。
- 所属 Topic: ad-datasets-benchmarks
- 学习路径: 学习路线 · 论文库
- 下一篇: A*3D Dataset: Towards Autonomous Driving in Challenging Environments
- 返回 Topic