世界模型
学习环境动力学以预测、想象与规划的世界模型方法。
类型 Topics · 更新 2026-07-20
本 Topic 要解决什么
Section titled “本 Topic 要解决什么”本Topic聚焦自动驾驶与具身智能中的世界模型构建,核心解决如何学习环境内部表征、潜在动态与生成式仿真器,以支持长时程预测、规划想象、闭环决策与仿真训练。传统开环运动预测与规则仿真难以处理复杂多代理交互、不确定性与长时依赖,导致规划脆弱与sim-to-real差距。通过3D占用预测、多视图视觉预报、潜在动作可适应模型等,世界模型使智能体能够内部模拟未来场景,实现从感知到行动的闭环,并与物理仿真器互补提升自主性、适应性与泛化。涵盖代理4D占用预报、驾驶专用占用世界模型、可适应潜在动作及闭环基准,弥合抽象认知与真实交互。
非目标 / 边界
Section titled “非目标 / 边界”- 不覆盖纯底层传感器硬件与标定细节
- 不深入非驾驶通用机器人操作技能学习
- 不展开传统规则规划或纯开环轨迹预测算法实现
- 不提供具体训练超参或未给出的实验数值
foundations— 需掌握基本感知、状态表征与预测规划框架,才能理解世界模型如何在其上构建内部动态world-modeling— 相邻主题提供通用世界模型与潜在动态基础,便于迁移到驾驶与具身场景simulation-synthetic— 需了解物理仿真器角色,才能把握其与学习世界模型的互补与sim-to-real问题
| 术语 | 含义 | 常见混淆 |
|---|---|---|
| 世界模型 | 智能体学习的内部环境表征与动态预测机制,用于模拟未来状态、支持规划想象与闭环决策 | 易与外部物理仿真器混淆,前者是学习式内部模型,后者是显式规则/物理引擎 |
| 潜在动态 | 在压缩潜在空间中建模状态转移与演化的动力学,便于高效预测与生成 | 不同于像素级或显式3D动态,强调抽象可压缩表征 |
| 生成式仿真器 | 基于生成模型(如扩散或自回归)的世界模拟器,可采样多样未来场景 | 非传统确定性仿真,侧重随机生成与数据驱动 |
| 4D占用预报 | 预测时空(3D+时间)占用网格的未来演化,作为世界模型代理任务 | 与点云预报相关,后者常作为其代理任务 |
| 闭环世界 | 模型预测与智能体行动交互反馈的评估与训练设定,而非开环单次预测 | 区别于开环数据集评估,强调实时交互与累积误差 |
| 潜在动作 | 可学习的抽象动作表示,用于可适应世界模型中控制潜在动态演化 | 非原始控制指令,而是潜在空间中的可迁移动作 |
方法谱系与时间线
Section titled “方法谱系与时间线”自动驾驶与具身智能从开环轨迹/占用预测转向学习式世界模型驱动的内部想象与闭环规划。从依赖显式HD地图与规则仿真,转向数据驱动的潜在动态与生成式仿真器。物理仿真器与世界模型从对立走向互补,共同弥合训练-部署差距。评估也从开环指标转向Real2Sim闭环基准,强调多视图视觉预报、3D占用与可适应潜在动作的统一框架。
- (2019) watch — Social-BiGAT: Multimodal Trajectory Forecasting using Bicycle-GAN and\n Graph Attention Networks
- (2021) watch — Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset
- (2021) watch — From Goals, Waypoints & Paths To Long Term Human Trajectory Forecasting
- (2023) recent — Point Cloud Forecasting as a Proxy for 4D Occupancy Forecasting
- (2023) recent — OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving
- (2024) watch — DriveDreamer: Towards Real-World-Drive World Models for Autonomous Driving
- (2024) recent — Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving
- (2025) foundational — AdaWorld: Learning Adaptable World Models with Latent Actions
- (2025) foundational — DriveE2E: Closed-Loop Benchmark for End-to-End Autonomous Driving through Real-to-Simulation
- (2025) foundational — World-in-World: World Models in a Closed-Loop World
- (2025) recent — The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey
- (2025) watch — A Survey: Learning Embodied Intelligence from Physical Simulators and World Models
- (2025) recent — Simulating the Visual World with Artificial Intelligence: A Roadmap
- OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving(精读)— 直接构建驾驶场景3D占用世界模型,体现潜在动态与未来预报核心范式
- The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey(精读)— 系统梳理世界模型在自动驾驶中的角色、分类与挑战,提供全景与路线
- Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving(精读)— 多视图视觉预报与规划结合世界模型的代表工作,连接感知到决策
推荐阅读路径
Section titled “推荐阅读路径”- 先读综合调研(Role of World Models Survey 与 Embodied Intelligence Survey)把握定义、分类与仿真器互补
- 精读OccWorld与Drive系列理解占用/视觉世界模型具体实现与驾驶应用
- 对照Point Cloud Forecasting代理任务与AdaWorld潜在动作扩展可适应性
- 结合DriveE2E与World-in-World闭环基准理解评估与Real2Sim实践
- 回顾运动预报经典(Waymo Open Motion等)作为对比基础
| Paper | 输入 | 输出 | 表示 | 训练目标 |
|---|---|---|---|---|
| OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving | 历史3D占用或相关观测 | 未来3D占用预测与世界模型演化 | 3D占用网格 | 学习驾驶场景世界模型支持预测与规划 |
| Point Cloud Forecasting as a Proxy for 4D Occupancy Forecasting | 历史点云序列 | 未来点云/作为4D占用代理 | 点云序列 | 以点云预报代理4D占用世界模型任务 |
| Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving | 多视图历史图像/观测 | 多视图未来视觉预报与规划轨迹 | 多视图视觉 + 世界模型 | 结合世界模型实现视觉预报与规划 |
| AdaWorld: Learning Adaptable World Models with Latent Actions | 观测与潜在动作相关输入 | 可适应的未来状态预测 | 潜在动态 + 潜在动作 | 提升世界模型对不同场景的可适应性 |
| DriveDreamer: Towards Real-World-Drive World Models for Autonomous Driving | 真实驾驶数据观测 | 真实世界驾驶世界模型生成/预测 | — | 构建面向真实驾驶的世界模型 |
工程实现与复现风险
Section titled “工程实现与复现风险”- 学习世界模型与物理仿真器的sim-to-real差距仍可能导致部署失效
- 高维占用/视觉生成与长时预测的计算与存储开销大
- 闭环评估依赖数字孪生与Real2Sim质量,场景覆盖与真实性不足
- 潜在动态与动作表示的可解释性、安全性验证困难
- 数据多样性与标注(交互、占用)成本高,易过拟合特定域
- 如何更有效融合物理仿真器的显式知识与学习世界模型的数据驱动能力
- 潜在动作与可适应世界模型如何在开放驾驶场景实现零样本或少样本迁移
- 闭环世界模型评估如何进一步缩小与真实道路测试的差距
- 4D占用与多视图视觉世界模型在长时程与多代理交互上的统一表征
- 世界模型如何支持端到端自动驾驶的可验证安全与可解释规划
Topic 自测清单
Section titled “Topic 自测清单”- 世界模型与物理仿真器在具身智能中的核心区别与互补作用是什么?
- OccWorld类方法如何将3D占用用于学习驾驶世界模型?其相对点云预报代理的优势?
- 闭环评估(如DriveE2E Real2Sim)相比开环运动数据集的关键改进点有哪些?
- 潜在动态与潜在动作如何帮助世界模型提升可适应性?
- 从开环轨迹预测到世界模型驱动规划的范式变迁主要体现在哪些方面?
选篇附录(registry)
Section titled “选篇附录(registry)”本 Topic registry 入选 13 篇(foundational/recent/watch 见 papers.yml)。
论文池(FRW)
Section titled “论文池(FRW)”来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5。
可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。
基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)
Section titled “基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)”- DriveE2E: Closed-Loop Benchmark for End-to-End Autonomous Driving through Real-to-Simulation (2025) · 中文笔记
- World-in-World: World Models in a Closed-Loop World (2025) · 精读
- AdaWorld: Learning Adaptable World Models with Latent Actions (2025) · 精读
近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)
Section titled “近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)”- The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey (2025) · 固定 · 中文笔记
- Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving (2024) · 固定 · 中文笔记
- Point Cloud Forecasting as a Proxy for 4D Occupancy Forecasting (2023) · 中文笔记
- Simulating the Visual World with Artificial Intelligence: A Roadmap (2025) · 中文笔记
- OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving (2023) · 中文笔记
观察清单(选题 5 · 可学习 3 · 待获取 PDF 2)
Section titled “观察清单(选题 5 · 可学习 3 · 待获取 PDF 2)”- A Survey: Learning Embodied Intelligence from Physical Simulators and World Models (2025) · 中文笔记
- Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset (2021) · 中文笔记
- From Goals, Waypoints & Paths To Long Term Human Trajectory Forecasting (2021) · 中文笔记
- DriveDreamer: Towards Real-World-Drive World Models for Autonomous Driving (2024) · 待获取 PDF
- Social-BiGAT: Multimodal Trajectory Forecasting using Bicycle-GAN and\n Graph Attention Networks (2019) · 待获取 PDF
成熟度 developing · 内容数 14 · 论文池 13