跳转到内容

扩散模型

扩散生成模型及其在表示、预测和策略生成中的学习入口。

类型 Topics · 更新 2026-07-19

标签 diffusion-models · generative-modeling

本Topic聚焦扩散模型作为具身智能与自动驾驶方法侧核心,解决传统单模态回归与固定锚点难以充分建模驾驶/操作动作的多模态分布、易模式坍塌以及直接迁移扩散时高去噪步数导致的实时性瓶颈问题。通过逐步加噪-去噪过程将轨迹或动作序列建模为生成式分布,支持从噪声采样到结构化输出的渐进恢复,兼顾多样性与质量。重点覆盖DiffusionDrive家族的截断扩散、锚定机制及RL约束变体,连接机器人视觉运动策略与端到端驾驶轨迹生成,服务于NAVSIM等闭环评估场景下的生成式规划与策略学习,推动从模仿学习向可控生成范式演进。

  • 不深入纯图像/视频生成扩散的数学推导与大规模预训练细节
  • 不覆盖非轨迹/策略输出的通用生成任务或化学等领域应用
  • 不讨论具体硬件加速、量化部署或工程代码实现
  • 不系统回顾路径规划经典算法全貌
  • foundations — 需具备生成模型、概率分布建模与基本深度学习训练框架基础,以理解加噪去噪过程
  • ad-end-to-end-driving — 扩散轨迹生成直接服务端到端驾驶闭环,需了解感知-规划一体化与NAVSIM类评估上下文
  • representation-generative — 与生成式表示及视动理解相关,便于衔接自监督与轨迹生成表征
术语 含义 常见混淆
扩散模型 通过前向加噪与反向去噪过程学习数据分布的生成模型,适用于轨迹与动作序列 易与VAE或GAN混淆,核心在于迭代去噪而非一次映射
去噪策略 将策略学习为从噪声条件恢复干净动作或轨迹的网络,常用于视觉运动策略 不同于标准RL策略直接输出动作,强调条件去噪生成
截断扩散 缩短去噪日程并结合锚定分布以大幅减少推理步数的加速变体 可能与完整扩散在表达力与稳定性上有权衡
生成式轨迹 从噪声采样生成多模态驾驶或操作轨迹的输出形式 区别于确定性回归或离散锚点选择
模式坍塌 生成模型仅覆盖部分行为模态而丢失多样性的现象 在多模态驾驶意图中尤为突出,影响闭环安全与探索
锚定高斯 以高斯分布锚点作为截断扩散起点以稳定多模态生成 与固定词汇锚点类似但融入扩散过程

早期自动驾驶与机器人策略多依赖行为克隆的单模态回归或离散锚点,难以捕捉不确定性与多样性。机器人领域引入动作扩散,将视觉运动策略建模为去噪生成过程,提升表达力。自动驾驶直接迁移面临高步数开销与模式坍塌,催生截断扩散、锚定与级联解码等适配。进一步结合强化学习约束负模式,在保留多模态的同时提升一致高质量,形成生成式规划与策略新范式。

  1. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion(精读)— 奠基性工作,将扩散模型系统引入视觉运动策略学习,定义动作扩散范式
  2. DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving(中文笔记)— 将截断扩散与锚定成功适配实时端到端驾驶轨迹生成,解决直接迁移瓶颈并有中文笔记
  3. MotionDiffuser: Controllable Multi-Agent Motion Prediction Using Diffusion(精读)— CVPR foundational工作,展示扩散在可控多代理运动预测中的应用
  1. 先精读Diffusion Policy掌握动作扩散与去噪策略基础
  2. 再读MotionDiffuser与score-based扩散策略理解预测与条件生成
  3. 结合中文笔记精读DiffusionDrive与V2,聚焦截断、锚定与RL约束在E2E驾驶中的适配
  4. 参考扩散机遇挑战综述与相关watch论文拓展多代理与操作场景
  5. 对照NAVSIM等评估思考闭环迁移与工程权衡
Paper 输入 输出 表示 训练目标
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion 视觉观察 动作序列/轨迹 动作扩散去噪过程 视觉运动策略模仿学习
DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving 驾驶场景感知特征 多模态驾驶轨迹 截断扩散+锚定高斯+级联解码 实时E2E多模态轨迹生成
MotionDiffuser: Controllable Multi-Agent Motion Prediction Using Diffusion 场景与代理状态(待核验细节) 多代理运动预测 扩散模型 可控多代理运动预测
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving 感知与锚点相关(待核验) RL约束下的多模态轨迹 截断扩散+GRPO类约束+GMM 兼顾多样性与高质量E2E轨迹
  • 去噪步数与推理延迟/实时性权衡,即使截断仍需仔细调度
  • 模式坍塌或多样性不足导致闭环行为单一或探索不足
  • 噪声日程、锚定质量与训练稳定性敏感,易受超参影响
  • 开环轨迹指标与闭环驾驶性能差距,评估迁移风险
  • 与感知表示耦合时,错误传播可能放大生成偏差
  • 如何进一步蒸馏或一步化扩散策略同时充分保留多模态表达力
  • RL约束与截断扩散结合的最优形式及尺度自适应噪声设计
  • 跨机器人操作与自动驾驶场景的迁移与统一框架
  • 生成式轨迹与其他表示(如高斯、隐空间)的融合边界
  • 在更复杂长尾与交互密集场景下的鲁棒性与安全保证
  1. 扩散模型如何通过加噪-去噪过程建模多模态动作或轨迹分布?与单模态回归的主要区别是什么?
  2. 什么是截断扩散?它在端到端自动驾驶中主要解决什么问题?
  3. 模式坍塌在生成式驾驶轨迹中如何表现?常见缓解思路有哪些?
  4. Diffusion Policy将策略学习定义为去噪过程的核心优势是什么?
  5. 对比DiffusionDrive与DiffusionDriveV2,后者引入的主要机制及其目标是什么?

本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
watch Visuomotor Understanding for Representation Learning of Driving Scenes 2019 coverage cross-assign watch from related topics for diffusio
watch Multi-task Learning with Attention for End-to-end Autonomous Driving 2021 coverage cross-assign watch from related topics for diffusio
watch One-Step Diffusion Policy: Fast Visuomotor Policies via Diffusion Distillation 2024 auto score=61
watch Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation 2025 auto score=71
recent Robotic VLA Benefits from Joint Learning with Motion Image Diffusion 2025 coverage promote watch->recent for diffusion-models
recent DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving 2024 DiffusionDrive — truncated diffusion for E2E trajectory gene
watch DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving 2025 DiffusionDriveV2 watch for E2E diffusion driving
recent Path planning algorithms in the autonomous driving system: A comprehensive review 2024 auto refresh 2026-07-19 sources=openalex
watch A review of large language models and autonomous agents in chemistry 2024 auto refresh 2026-07-19 sources=openalex
recent Opportunities and challenges of diffusion models for generative AI 2024 NSR survey diffusion models opportunities/challenges
foundational MotionDiffuser: Controllable Multi-Agent Motion Prediction Using Diffusion 2023 MotionDiffuser CVPR 2023 multi-agent motion diffusion founda
recent Diffusion-ES: Gradient-Free Planning with Diffusion for Autonomous and Instruction-Guided Driving 2024 auto refresh 2026-07-19 sources=openalex
watch Hierarchical Diffusion Policy: Manipulation Trajectory Generation via Contact Guidance 2025 auto score=60
watch SGD: Street View Synthesis with Gaussian Splatting and Diffusion Prior 2025 Street view Gaussian+diffusion prior watch
foundational Diffusion Policy: Visuomotor Policy Learning via Action Diffusion 2023 Diffusion Policy (RSS 2023) foundational action diffusion
foundational Goal-Conditioned Imitation Learning using Score-based Diffusion Policies 2023 Score-based diffusion policy foundational

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)

Section titled “基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)”

近期重要(选题 5 · 可学习 3 · 待获取 PDF 2)

Section titled “近期重要(选题 5 · 可学习 3 · 待获取 PDF 2)”

观察清单(选题 8 · 可学习 8 · 待获取 PDF 0)

Section titled “观察清单(选题 8 · 可学习 8 · 待获取 PDF 0)”

端到端学习 · 强化学习

成熟度 seed · 内容数 16 · 论文池 16