表征学习与生成建模
表征学习与生成建模
Section titled “表征学习与生成建模”学习通用表征与生成模型的方法,含扩散、自监督与多模态预训练。
类型 Topics · 更新 2026-07-20
本 Topic 要解决什么
Section titled “本 Topic 要解决什么”本Topic聚焦自动驾驶与具身智能中的表征学习与生成建模,解决如何从多相机/多模态传感数据中学习紧凑、统一、可泛化的场景表征(如BEV网格、语义图、场景token、潜在动作),并利用生成模型(扩散、世界模型等)合成新视角/新场景、预测轨迹或生成动作策略。核心挑战包括跨视角一致性、几何与语义融合、时序建模、以及生成结果的可控性与可解释性,以支撑下游感知、预测、规划与仿真,弥补传统判别式方法在数据稀缺、长尾场景与反事实推理上的不足。
非目标 / 边界
Section titled “非目标 / 边界”- 纯判别式检测/分割网络细节与损失函数调优
- 底层硬件传感器标定与实时控制系统实现
- 非交通/非具身场景的通用图像生成艺术创作
foundations— 需具备多视图几何、Transformer注意力与基础表征学习概念,才能理解BEV查询与时空聚合world-models— 相邻主题,世界模型是生成式表征的重要应用载体diffusion-models— 相邻主题,扩散机制支撑动作生成与场景合成
| 术语 | 含义 | 常见混淆 |
|---|---|---|
| BEV表征 | 鸟瞰图统一特征网格,通过时空Transformer从多相机图像自适应聚合信息,支持3D检测与地图分割等任务 | 易与直接深度估计再投影混淆;BEVFormer强调无需显式深度的查询式聚合 |
| 场景token | 将驾驶/交通场景离散或连续编码为可生成、可组合的潜在单元,便于语义推理与合成 | 与普通视觉token区别在于强调几何-语义一致性与多任务可复用 |
| 生成式世界模型 | 学习环境动态与潜在状态转移的生成模型,可进行未来预测、新场景合成或动作条件生成 | 与纯预测器区别在于强调生成采样与反事实仿真能力 |
| 扩散策略 | 将动作生成建模为扩散过程的视觉运动策略学习方法,从噪声逐步去噪得到动作序列 | 易与图像扩散混淆;此处目标是动作空间而非像素 |
| 潜在动作 | 在可适应世界模型中学习的抽象动作表征,支持跨环境迁移与可控生成 | 与原始控制指令区别在于潜在空间解耦与可组合性 |
| 知识图谱场景表征 | 将交通场景实体、关系与语义组织为图结构,用于轨迹预测等任务 | 与纯视觉特征图区别在于显式符号化语义与关系推理 |
方法谱系与时间线
Section titled “方法谱系与时间线”早期以判别式特征提取与手工规则为主,侧重检测分类。随后BEV与统一网格表征兴起,通过时空注意力从多相机直接学习可复用场景特征。近年来转向生成建模:扩散用于动作与场景合成,世界模型支持潜在动态与自由视角生成,知识图谱与token化进一步融合语义与几何。范式从“识别现状”转向“生成可能与预测未来”,强调可控、可适应与多模态一致性。
- (2019) foundational — Visuomotor Understanding for Representation Learning of Driving Scenes
- (2021) recent — Deep Reinforcement Learning for Autonomous Driving: A Survey
- (2022) watch — BEVFormer: Learning Bird’s-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers
- (2023) foundational — Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- (2023) watch — nuScenes Knowledge Graph – A comprehensive semantic representation of traffic scenes for trajectory prediction
- (2023) recent — Deep learning modelling techniques: current progress, applications, advantages, and challenges
- (2024) recent — Generative artificial intelligence: a systematic review and applications
- (2024) recent — Opportunities and challenges of diffusion models for generative AI
- (2024) watch — A controllable generative model for generating pavement crack images in complex scenes
- (2025) foundational — A generative model for inorganic materials design
- (2025) watch — The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey
- (2025) watch — AdaWorld: Learning Adaptable World Models with Latent Actions
- (2025) recent — 3D Scene Generation: A Survey
- (2025) watch — FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
- (2025) watch — Robotic VLA Benefits from Joint Learning with Motion Image Diffusion
- (2025) watch — MUVO: A Multimodal Generative World Model for Autonomous Driving with Geometric Representations
- BEVFormer: Learning Bird’s-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers(中文笔记)— 奠定从多相机图像学习统一BEV表征的范式,支持多感知任务且改善时序与低可见度表现,是表征学习核心基石
- 3D Scene Generation: A Survey(中文笔记)— 系统梳理3D场景生成四大范式、表示、数据集、评估与自动驾驶/世界模型应用,建立领域全景与趋势把握
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion(精读)— 将生成建模引入视觉运动控制,示范动作扩散表征,连接表征学习与策略生成
推荐阅读路径
Section titled “推荐阅读路径”- 先读BEVFormer理解统一BEV表征与时空Transformer聚合机制
- 再读3D Scene Generation综述把握生成范式分类与自动驾驶关联
- 精读Diffusion Policy掌握动作生成建模
- 浏览nuScenes Knowledge Graph与MUVO/AdaWorld/FreeGen等近期工作,对比语义图、多模态世界模型与自由视角合成
- 结合世界模型与扩散模型相邻主题深化应用
| Paper | 输入 | 输出 | 表示 | 训练目标 |
|---|---|---|---|---|
| BEVFormer | 多相机图像与历史BEV | 统一BEV特征支持3D检测与地图分割 | 预定义网格BEV查询+时空注意力 | 多任务感知性能提升 |
| Diffusion Policy | 视觉观测 | 动作序列 | 动作扩散过程 | 视觉运动策略学习 |
| 3D Scene Generation: A Survey | 噪声/文本/图像/视频等条件 | 3D场景表示 | 程序化/神经3D/图像基/视频基等多范式 | 空间连贯可渲染3D场景生成 |
| nuScenes Knowledge Graph | 交通场景数据 | 语义表征用于轨迹预测 | 知识图谱 | — |
| FreeGen | 驾驶场景数据 | 自由视角合成 | 重建-生成协同训练 | — |
工程实现与复现风险
Section titled “工程实现与复现风险”- 生成模型可能产生几何或语义不一致的伪影,影响下游安全决策
- 多相机时序聚合对标定误差与遮挡敏感,易导致表征漂移
- 潜在空间与世界模型训练数据覆盖不足时,长尾场景泛化差
- 扩散与高分辨率场景生成计算开销大,实时部署困难
- 知识图谱与token表征的人工标注或自动构建噪声影响语义准确性
- 如何实现跨传感器、跨天气的场景token统一与可组合生成
- 生成式世界模型在闭环规划中的安全性与可验证性如何保障
- 潜在动作表征的可解释性与人类指令对齐问题
- 自由视角合成与真实传感器数据分布的对齐差距如何缩小
- 大规模交通知识图谱的自动构建与增量更新机制
Topic 自测清单
Section titled “Topic 自测清单”- BEVFormer如何通过预定义BEV查询与时空注意力实现无需显式深度估计的统一表征?
- 3D场景生成综述中划分的四大范式分别是什么?各自主要优缺点?
- Diffusion Policy将动作生成建模为扩散过程的核心优势是什么?与传统策略学习有何不同?
- nuScenes Knowledge Graph试图提供何种语义表征?其主要服务于什么下游任务?
- 在表征学习向生成建模转变过程中,场景token与潜在动作各自解决了什么问题?
选篇附录(registry)
Section titled “选篇附录(registry)”本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。
子 Topic
Section titled “子 Topic”论文池(FRW)
Section titled “论文池(FRW)”来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5。
可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。
基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)
Section titled “基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)”- A generative model for inorganic materials design (2025) · 中文笔记
- Visuomotor Understanding for Representation Learning of Driving Scenes (2019) · 中文笔记
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (2023) · 待获取 PDF
近期重要(选题 5 · 可学习 2 · 待获取 PDF 3)
Section titled “近期重要(选题 5 · 可学习 2 · 待获取 PDF 3)”- Generative artificial intelligence: a systematic review and applications (2024) · 中文笔记
- 3D Scene Generation: A Survey (2025) · 中文笔记
- Opportunities and challenges of diffusion models for generative AI (2024) · 待获取 PDF
- Deep Reinforcement Learning for Autonomous Driving: A Survey (2021) · 待获取 PDF
- Deep learning modelling techniques: current progress, applications, advantages, and challenges (2023) · 待获取 PDF
观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)
Section titled “观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)”- The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey (2025) · 中文笔记
- AdaWorld: Learning Adaptable World Models with Latent Actions (2025) · 精读
- Robotic VLA Benefits from Joint Learning with Motion Image Diffusion (2025) · 中文笔记
- BEVFormer: Learning Bird’s-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers (2022) · 精读
- nuScenes Knowledge Graph – A comprehensive semantic representation of traffic scenes for trajectory prediction (2023) · 中文笔记
- FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis (2025) · 中文笔记
- MUVO: A Multimodal Generative World Model for Autonomous Driving with Geometric Representations (2025) · 中文笔记
- A controllable generative model for generating pavement crack images in complex scenes (2024) · 待获取 PDF
聚合内容(子树)
Section titled “聚合内容(子树)”成熟度 seed · 内容数 29 · 论文池 16