跳转到内容

Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset

Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset

Section titled “Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset”

⚠️ AI 生成 · 建议对照原文 本页为自动整理的学习笔记;关键数据与引用如需引用,请回查 PDF / 官方版本。

学习档位 中文笔记

类型 文献 · 更新 2026-07-19

所属 预测、规划与控制 · 自动驾驶数据集、基准与评测 · 数据工程与数据闭环 · 世界模型

中文学习笔记(自动生成,需核验)

Section titled “中文学习笔记(自动生成,需核验)”

Topic: prediction-planning-control · Tier: recent · Year: 2021 · Venue:
Evidence level: partial · 本地全文: 是 · 建议阅读: ~40 分钟
Paper: https://arxiv.org/abs/2104.10133
Code:
Generator: grok

这是Waymo发布的大规模交互式运动预测数据集论文,聚焦合并、无保护转弯等真实交互场景,提供联合预测标注、高质量offboard 3D tracks、HD地图和新型联合/个体评估指标,是自动驾驶具身智能运动预测方向的基础资源,能推动从单代理到多代理联合行为建模的研究。

引入迄今最多样化的交互式运动数据集Waymo Open Motion Dataset(>10万场景、574小时、1750km道路),带特定交互对象标注、高质量自动3D标注和面向联合预测的新指标与基线。

自动驾驶规划需要处理复杂交互场景(如合并、无保护转弯、行人过街等),仅预测单个对象运动不足,必须进行多对象联合预测;现有数据集规模、交互丰富度、标注质量和联合评估指标不足,真实数据分布高度不平衡(多数为匀速直行),难以支持有效模型开发。

自动驾驶运动/轨迹预测基础、多代理交互建模、常见指标(ADE/FDE)、3D目标检测与跟踪、地图表示(lane centers/boundaries等)、机器学习中的多模态预测与联合分布建模。

  • 发布大规模交互运动数据集,含特定标注的交互行为(车辆-车辆、车辆-行人、车辆-自行车等),来自多城市多样化场景的高质量offboard感知输出与HD 3D地图。
  • 提出面向个体与联合预测的新型评估指标(包括受目标检测启发的mAP,覆盖对象类型、时间尺度和轨迹形状桶),并提供challenging benchmarks。
  • 提供个体预测与联合预测的强基线模型;数据集包含>100,000个20秒场景(10Hz)、>570小时独特数据、1750km道路,覆盖6座美国城市。

从大规模驾驶语料中用语义谓词(如变道、路径交叉、相对航向差、近距/高加速度交互等)挖掘交互场景 → 生成20秒片段并切分为9.1秒场景 → 使用offboard感知系统(3D检测+多目标跟踪+对象中心细化网络)自动生成高精度时序一致的3D bounding box tracks与速度 → 提供静态/动态地图特征(polylines/polygons、交通信号等) → 划分标准版(最多8个预测对象,偏向非匀速/非直线)与交互版(仅2个交互对象)验证/测试集 → 定义联合预测指标与提供基线模型。

数据挖掘:手写语义谓词组合(SQL/关系型查询)挖掘合并、变道、无保护转弯、交叉口左右转、行人/自行车-车辆交互、近距与高加速度场景,交互发生在约10s时刻并显式标注交互对。Offboard感知:利用完整点云序列(历史+未来)和更强模型,相比onboard减少状态估计噪声、提升时序一致性。地图:0.5m分辨率采样的lane centers/boundaries、road edges、stop signs、crosswalks、speed bumps及交通信号状态。指标设计:将个体预测视为联合预测特例;minADE/minFDE取最优联合配置;Overlap rate基于最高置信联合预测的box交叉;Miss rate用多阈值IS_MATCH(适配不同速度);新型mAP覆盖对象类型、预测时间尺度与轨迹形状。取舍:优先高质量自动标注与交互多样性而非实时onboard感知;预测时域延长至8秒以支持长时规划。

数据集:>100k场景,每场景20s@10Hz(切为9.1s训练/评估用),总约574h,1750km独特道路,6城市,3类对象(车/行人/自行车),3D boxes(中心、航向、长宽高、速度)+ valid flag + HD地图(polylines/polygons)+交通信号;交互版聚焦2个交互对象,标准版最多8个(偏向复杂轨迹);70/15/15划分,另提供原始20s片段。统计:46%场景>32 agents,11%>64;验证集33.5%含行人预测、10.4%含自行车;交互场景中77.5%车-车、14.9%车-人、7.6%车-自行车。指标:minADE、minFDE(最优联合)、Overlap rate(OR)、Miss rate(MR)、新型mAP(单/联合,按类型/时间/形状);基线为个体与联合预测模型。

提供强基线模型用于个体与联合预测;offboard感知质量在文中Section 5.3有验证(优于onboard);具体数值指标与对比实验结果待来源核验。

依赖offboard自动标注质量(虽优于onboard但仍可能有残留误差);挖掘基于手写谓词,可能遗漏某些交互类型;交互版仅聚焦2对象联合,标准版最多8对象;长时(8s)预测难度高且数据不平衡问题仍存在;完整失败场景分析与适用边界(如极端天气/罕见几何)待来源核验。

与前序 / 同期 / 后续方法的关系

Section titled “与前序 / 同期 / 后续方法的关系”

对比Lyft Level 5(最长小时数但交互多样性不足)、NuScenes(丰富分类但规模小)、Argoverse(偏向有趣行为/路口)、INTERACTION(手动选特定地点/时段);大多数数据集侧重单代理且无联合指标;联合一致多代理预测相关工作包括Precog、MFP(逐步条件rollout)和ILVM/TrafficSim(潜变量解码多步联合样本),这些用更严格的最优联合配置误差;本数据集首次在发布中提供联合指标。

数据集将公开提供给研究社区(Waymo Open Motion Dataset);官方代码与完整复现细节(基线训练配置、评估脚本等)待来源核验;建议从官方发布页面获取数据与baseline实现,按标准/交互划分评估minADE/minFDE/OR/MR/mAP。

先读Abstract与Introduction(问题与动机)→ Table 1与Section 2 Related Work(定位)→ Section 3 Dataset(挖掘、统计、offboard感知)→ 指标定义部分(Section 4)→ 基线与实验(若有)→ 结论;重点关注交互挖掘准则、联合指标设计与数据集统计图。

  1. Q: 为什么现有数据集对交互场景建模不足?本数据集如何解决? A: 多数数据集侧重单代理、数据不平衡(多为匀速直行)、交互标注少且无联合指标;本数据集通过语义谓词大规模挖掘交互(合并/变道/无保护转弯/行人-车等),显式标注交互对象对,并提供联合预测指标与标准/交互验证集。
  2. Q: offboard感知系统相比onboard有何优势?包含哪三步? A: 优势:更强模型+充足算力、可聚合完整点云序列(历史+未来)信息,生成更高精度、时序一致的3D tracks,减少感知噪声。三步:每帧3D目标检测生成proposals → 多目标跟踪链接序列 → 对象中心细化网络输出每帧时序一致准确的3D boxes。
  3. Q: 数据集中交互版与标准版验证/测试集有何区别? A: 交互版聚焦场景交互部分,仅要求预测2个被挖掘的交互对象(联合预测);标准版每场景最多提供8个预测对象,选择偏向非匀速/非直线轨迹;两者均从20s交互挖掘片段派生,另提供原始20s用于长时研究。
  4. Q: 提出的主要联合预测指标有哪些?minADE如何计算? A: minADE(最优联合配置的平均L2位移误差)、minFDE(最终时间步)、Overlap rate(最高置信联合预测的box交叉率)、Miss rate(基于多阈值匹配)、新型mAP。minADE:对每个联合预测取与真值最接近的模态,再对agents与时间步平均L2。
  5. Q: 数据集规模与多样性关键数字是什么? A: 超过100,000场景,每个20秒@10Hz,总>570小时独特数据,覆盖1750km道路、6座美国城市;3类对象;46%场景>32 agents;交互场景中约77.5%车-车交互等(具体见图2/3与Table 1)。
  • Abstract (page 1): With over 100,000 scenes, each 20 seconds long at 10 Hz, our new dataset contains more than 570 hours of unique data over 1750 km of roadways. It was collected by mining for interesting interactions between vehicles, pedestrians, and cyclists across six cities within the United States.
  • Introduction (page 1-2): We argue that critical situations (e.g., merges, lane changes, and unprotected turns) require the joint prediction of a set of multiple interacting objects, not just a single object. … We explicitly annotate groups of interacting objects in both training and validation/test data
  • Table 1 (page 2): Ours: # unique tracks 7.64 m, Avg track length 7.04 s, Time horizon 8s, # segments 104k, Segment duration 20 s, Total time 574 h, Unique roadways 1750 km, Sampling rate 10 Hz, # cities covered 6, # object types 3, Boxes 3D, 3D maps, Offline perception, Interactions, Traffic signal states
  • Section 3.1 (page 3): we specifically mined for the following pairwise interaction scenarios: merges, lane changes, unprotected turns, intersection left turns, intersection right turns, pedestrian-vehicle interactions, cyclist-vehicle interactions, interactions with close proximity, and interactions with high accelerations. The pair of interacting objects is annotated
  • Section 3.3 / Metrics (page 5): minADE. The minimum Average Displacement Error computes the L2 norm between ŝ and the closest joint prediction: … We aim to alleviate the perception quality bottleneck … by employing an offboard 3D detection and tracking pipeline
  • topic: prediction-planning-control
  • sources: openalex
  • retrieved_at: 2026-07-20
  • query: joint motion prediction and planning autonomous driving
  • doi: 10.1109/iccv48922.2021.00957
  • score_total: 55
  • suggested_tier: recent

(no prose relevance explanation — numeric score only or HTTP source)

(no snippet evidence in candidate pool)

生成:2026-07-21 · 来源条数 2 · 模型 heuristic · 需人工核验数字

围绕「Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset」的核心问题与动机(待结合全文核验)。

  • 见原文方法章节;以下为基于摘要/摘录的要点提示。
  • Large Scale Interactive Motion Forecasting for Autonomous Driving : The WAYMO O PEN M…

与相近工作的关系待核验;请对照 related work。

  • 勿仅凭摘要推断未给出的数值指标。
  1. 这篇工作的输入/输出表示是什么?(Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset)
  2. 训练目标与评测协议各是什么?
  3. 主要失败模式或局限是什么?
flowchart LR
A["输入 / 观测"] --> B["表示 / 编码"]
B --> C["推理 / 解码"]
C --> D["输出 / 动作或检测"]
%% method sketch for: Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Op

方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。

Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset arch p.1

来源:原论文约 p.1(arch);学习用途摘录。

Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset table p.2

来源:原论文约 p.2(table);学习用途摘录。

展开英文 Paper Card / AI deep analysis
Field Content
Year 2021
Authors Scott Ettinger, Shuyang Cheng, Benjamin Caine, Chenxi Liu, Hang Zhao, Sabeek Pradhan, Yuning Chai, Ben Sapp, Charles R. Qi, Yin Zhou, Zoey Yang, Aurélien Chouard
arXiv 2104.10133
DOI 10.1109/iccv48922.2021.00957
Topics prediction-planning-control, ad-datasets-benchmarks, data-engineering, world-modeling, world-models
Paper https://arxiv.org/abs/2104.10133
展开 Extract / Selections / Local assets
  • prediction-planning-control: tier=recent rank=2 score=55 — auto refresh 2026-07-19 sources=openalex
  • ad-datasets-benchmarks: tier=watch rank=5 score=57 — cross-topic assign from registry title match=2 keywords; 2026-07-19
  • data-engineering: tier=watch rank=2 score=63 — cross-topic assign from registry title match=3 keywords; 2026-07-19
  • world-modeling: tier=watch rank=2 score=51 — cross-topic assign from registry title match=1 keywords; 2026-07-19
  • world-models: tier=watch rank=3 score=51 — cross-topic assign from registry title match=1 keywords; 2026-07-19
(no PDF text available; metadata-only card)