跳转到内容

行为与运动预测

对他车/行人/智能体未来轨迹与行为的预测。

类型 Topics · 更新 2026-07-19

本Topic聚焦自动驾驶中交通参与者的行为与运动预测问题:在观测到历史轨迹、道路地图与周围智能体交互的条件下,准确预测未来多模态轨迹分布。核心挑战包括智能体意图的多模态性(如左转/直行/变道)、场景一致性、多智能体联合预测、长期预测的误差累积与mode collapse。目标是构建高效可扩展的模型(如基于Transformer的意图查询机制),在Waymo Motion与Argoverse 2等数据集上生成符合物理与社会规范的轨迹,为下游规划控制提供可靠输入,同时支持单智能体到多智能体、目标候选到直接回归的范式。

  • 不覆盖完整的端到端规划与控制闭环
  • 不深入传感器原始感知与检测跟踪
  • 不涉及具体硬件部署与实时系统优化细节
  • 不讨论非自动驾驶场景的通用人体动作预测
  • foundations — 需掌握轨迹表示、地图编码、多模态分布与基础序列建模知识,以便理解预测输入输出与评估指标
  • ad-prediction-planning-control — 了解预测与规划耦合的基本框架,便于认识运动预测在闭环决策中的定位与接口
术语 含义 常见混淆
多模态运动预测 对同一观测历史输出多种可能未来轨迹及其概率,覆盖不同行为意图 易与单一最可能轨迹混淆,或误以为仅靠后处理采样即可,而忽略训练时的多模态建模
意图查询(Intention Query) 可学习的查询向量,用于在Transformer解码中定位全局意图并精炼局部轨迹 与密集目标候选点易混淆;查询是稀疏自适应的,而非固定网格锚点
Mode Collapse 模型输出的多模态轨迹退化成少数相似模式,无法覆盖真实多样行为 常被归因于数据不平衡,实则与解码器结构、损失函数与训练策略强相关
对称场景建模 在多智能体预测中对场景进行对称处理,使任意智能体均可作为中心进行联合建模 与简单拼接所有智能体特征不同,强调一致性与互导查询
全局意图定位与局部运动精炼 MTR类方法将预测分解为先定位粗意图再精炼细轨迹的联合优化过程 易与纯回归或纯分类式目标预测对立看待,实际是两者优点的融合
堆叠Transformer 多层Transformer依次聚合历史轨迹、地图与社会交互特征,支持固定proposal查询 与单一Transformer编码器-解码器结构混淆,堆叠强调层次化多源融合

早期依赖Social-LSTM/GAN或图注意力的社交交互建模,转向Transformer对长程依赖与多源上下文的高效聚合。从密集目标候选或直接回归,演进到可学习意图查询实现全局定位与局部精炼。进一步扩展到多智能体对称建模与扩散可控生成,以提升场景一致性与多样性。

  1. MTR: Motion Transformer with Global Intention Localization and Local Movement Refinement(精读)— 奠定意图查询对与联合优化范式,兼具目标候选与直接回归优点,成为后续MTR家族与Transformer预测的基线
  2. MTR++: Multi-Agent Motion Prediction With Symmetric Scene Modeling and Guided Intention Querying(中文笔记)— 在MTR基础上引入对称场景与互导意图查询,实现多智能体高效一致预测,直接扩展单智能体框架
  3. Multimodal Motion Prediction with Stacked Transformers(中文笔记)— 早期展示堆叠Transformer与区域训练策略如何显式建模多模态并缓解mode collapse,为层次化上下文聚合提供经典参考
  1. 先读Human motion trajectory prediction survey建立问题全景与早期方法脉络
  2. 精读MTR掌握意图查询、全局定位与局部精炼核心机制
  3. 对照mmTransformer理解堆叠Transformer与proposal查询的差异
  4. 研读MTR++学习多智能体对称建模与互导查询扩展
  5. 选读MotionDiffuser等了解扩散可控生成作为补充范式
Paper 输入 输出 表示 训练目标
MTR: Motion Transformer with Global Intention Localization and Local Movement Refinement 智能体历史轨迹与道路地图 多模态未来轨迹 运动查询对(静态意图+动态搜索) 联合全局意图定位与局部运动精炼
MTR++: Multi-Agent Motion Prediction With Symmetric Scene Modeling and Guided Intention Querying 多智能体历史与对称场景 多智能体一致多模态轨迹 对称场景建模+互导意图查询 多智能体联合高效预测
Multimodal Motion Prediction with Stacked Transformers 历史轨迹、地图与社会交互 多模态轨迹proposal 堆叠Transformer+固定独立proposal查询 层次化多源上下文聚合与区域训练缓解mode collapse
MotionDiffuser: Controllable Multi-Agent Motion Prediction Using Diffusion 多智能体场景条件 可控多模态轨迹 扩散模型
  • 多模态输出易出现mode collapse导致行为覆盖不足
  • 多智能体联合建模计算与内存开销随智能体数量快速增长
  • 长期预测误差累积与地图编码精度敏感
  • 训练目标与真实闭环规划指标存在gap
  • 对稀有交互场景与分布外数据泛化能力有限
  • 如何在保持效率的同时进一步提升多智能体场景一致性与交互真实性
  • 意图查询机制如何更好融合语言/高层语义指令实现可控预测
  • 弱监督与自监督范式能否降低对密集标注轨迹的依赖
  • 预测不确定性如何更可靠地传递给下游规划以提升安全性
  • 扩散类生成方法与查询类方法在实时性与多样性上的最佳权衡
  1. MTR中运动查询对如何同时实现全局意图定位与局部轨迹精炼?与纯目标候选法相比优势何在?
  2. mmTransformer的堆叠结构与区域训练策略如何缓解mode collapse?
  3. MTR++的对称场景建模与互导意图查询解决了多智能体预测中的哪些核心问题?
  4. 多模态运动预测中输入通常包含哪些要素?输出如何表示不确定性?
  5. 从Social-GAN类方法到Transformer意图查询再到扩散模型,范式变迁的主要驱动力是什么?

本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
recent MTR++: Multi-Agent Motion Prediction With Symmetric Scene Modeling and Guided Intention Querying 2024 MTR++ multi-agent motion prediction with symmetric scene mod
watch Weakly and Self-Supervised Class-Agnostic Motion Prediction for Autonomous Driving 2025 auto score=40
foundational Multimodal Motion Prediction with Stacked Transformers 2021 CVPR 2021 mmTransformer — stacked transformers for multimoda
recent MotionDiffuser: Controllable Multi-Agent Motion Prediction Using Diffusion 2023 auto refresh 2026-07-19 sources=openalex
recent From Goals, Waypoints & Paths To Long Term Human Trajectory Forecasting 2021 auto refresh 2026-07-19 sources=openalex
recent Multi-modal Motion Prediction with Transformer-based Neural Network for Autonomous Driving 2022 auto refresh 2026-07-19 sources=openalex,crossref
watch Trajectory Prediction for Autonomous Driving Using Spatial-Temporal Graph Attention Transformer 2022 auto refresh 2026-07-19 sources=openalex
recent Interaction-Aware Trajectory Prediction for Safe Motion Planning in Autonomous Driving: A Transformer-Transfer Learning Approach 2025 auto refresh 2026-07-19 sources=openalex
watch HDGT: Heterogeneous Driving Graph Transformer for Multi-Agent Trajectory Prediction via Scene Encoding 2023 auto refresh 2026-07-19 sources=openalex
watch Out-of-Sight Embodied Agents: Multimodal Tracking, Sensor Fusion, and Trajectory Forecasting 2026 auto score=40
watch Hierarchical Light Transformer Ensembles for Multimodal Trajectory Forecasting 2025 auto score=40
foundational Human motion trajectory prediction: a survey 2020 auto refresh 2026-07-19 sources=openalex
watch DeepAccident: A Motion and Accident Prediction Benchmark for V2X Autonomous Driving 2024 auto refresh 2026-07-19 sources=openalex
watch Social-BiGAT: Multimodal Trajectory Forecasting using Bicycle-GAN and\n Graph Attention Networks 2019 auto refresh 2026-07-19 sources=openalex
watch Trajectory Forecasts in Unknown Environments Conditioned on Grid-Based Plans 2020 auto refresh 2026-07-19 sources=openalex
foundational MTR: Motion Transformer with Global Intention Localization and Local Movement Refinement 2022 MTR is the canonical transformer motion prediction baseline

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)

Section titled “基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)”

近期重要(选题 5 · 可学习 3 · 待获取 PDF 2)

Section titled “近期重要(选题 5 · 可学习 3 · 待获取 PDF 2)”

观察清单(选题 8 · 可学习 3 · 待获取 PDF 5)

Section titled “观察清单(选题 8 · 可学习 3 · 待获取 PDF 5)”

成熟度 seed · 内容数 16 · 论文池 16