跳转到内容

表征学习与生成建模

学习通用表征与生成模型的方法,含扩散、自监督与多模态预训练。

类型 Topics · 更新 2026-07-20

本Topic聚焦自动驾驶与具身智能中的表征学习与生成建模,解决如何从多相机/多模态传感数据中学习紧凑、统一、可泛化的场景表征(如BEV网格、语义图、场景token、潜在动作),并利用生成模型(扩散、世界模型等)合成新视角/新场景、预测轨迹或生成动作策略。核心挑战包括跨视角一致性、几何与语义融合、时序建模、以及生成结果的可控性与可解释性,以支撑下游感知、预测、规划与仿真,弥补传统判别式方法在数据稀缺、长尾场景与反事实推理上的不足。

  • 纯判别式检测/分割网络细节与损失函数调优
  • 底层硬件传感器标定与实时控制系统实现
  • 非交通/非具身场景的通用图像生成艺术创作
  • foundations — 需具备多视图几何、Transformer注意力与基础表征学习概念,才能理解BEV查询与时空聚合
  • world-models — 相邻主题,世界模型是生成式表征的重要应用载体
  • diffusion-models — 相邻主题,扩散机制支撑动作生成与场景合成
术语 含义 常见混淆
BEV表征 鸟瞰图统一特征网格,通过时空Transformer从多相机图像自适应聚合信息,支持3D检测与地图分割等任务 易与直接深度估计再投影混淆;BEVFormer强调无需显式深度的查询式聚合
场景token 将驾驶/交通场景离散或连续编码为可生成、可组合的潜在单元,便于语义推理与合成 与普通视觉token区别在于强调几何-语义一致性与多任务可复用
生成式世界模型 学习环境动态与潜在状态转移的生成模型,可进行未来预测、新场景合成或动作条件生成 与纯预测器区别在于强调生成采样与反事实仿真能力
扩散策略 将动作生成建模为扩散过程的视觉运动策略学习方法,从噪声逐步去噪得到动作序列 易与图像扩散混淆;此处目标是动作空间而非像素
潜在动作 在可适应世界模型中学习的抽象动作表征,支持跨环境迁移与可控生成 与原始控制指令区别在于潜在空间解耦与可组合性
知识图谱场景表征 将交通场景实体、关系与语义组织为图结构,用于轨迹预测等任务 与纯视觉特征图区别在于显式符号化语义与关系推理

早期以判别式特征提取与手工规则为主,侧重检测分类。随后BEV与统一网格表征兴起,通过时空注意力从多相机直接学习可复用场景特征。近年来转向生成建模:扩散用于动作与场景合成,世界模型支持潜在动态与自由视角生成,知识图谱与token化进一步融合语义与几何。范式从“识别现状”转向“生成可能与预测未来”,强调可控、可适应与多模态一致性。

  1. BEVFormer: Learning Bird’s-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers(中文笔记)— 奠定从多相机图像学习统一BEV表征的范式,支持多感知任务且改善时序与低可见度表现,是表征学习核心基石
  2. 3D Scene Generation: A Survey(中文笔记)— 系统梳理3D场景生成四大范式、表示、数据集、评估与自动驾驶/世界模型应用,建立领域全景与趋势把握
  3. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion(精读)— 将生成建模引入视觉运动控制,示范动作扩散表征,连接表征学习与策略生成
  1. 先读BEVFormer理解统一BEV表征与时空Transformer聚合机制
  2. 再读3D Scene Generation综述把握生成范式分类与自动驾驶关联
  3. 精读Diffusion Policy掌握动作生成建模
  4. 浏览nuScenes Knowledge Graph与MUVO/AdaWorld/FreeGen等近期工作,对比语义图、多模态世界模型与自由视角合成
  5. 结合世界模型与扩散模型相邻主题深化应用
Paper 输入 输出 表示 训练目标
BEVFormer 多相机图像与历史BEV 统一BEV特征支持3D检测与地图分割 预定义网格BEV查询+时空注意力 多任务感知性能提升
Diffusion Policy 视觉观测 动作序列 动作扩散过程 视觉运动策略学习
3D Scene Generation: A Survey 噪声/文本/图像/视频等条件 3D场景表示 程序化/神经3D/图像基/视频基等多范式 空间连贯可渲染3D场景生成
nuScenes Knowledge Graph 交通场景数据 语义表征用于轨迹预测 知识图谱
FreeGen 驾驶场景数据 自由视角合成 重建-生成协同训练
  • 生成模型可能产生几何或语义不一致的伪影,影响下游安全决策
  • 多相机时序聚合对标定误差与遮挡敏感,易导致表征漂移
  • 潜在空间与世界模型训练数据覆盖不足时,长尾场景泛化差
  • 扩散与高分辨率场景生成计算开销大,实时部署困难
  • 知识图谱与token表征的人工标注或自动构建噪声影响语义准确性
  • 如何实现跨传感器、跨天气的场景token统一与可组合生成
  • 生成式世界模型在闭环规划中的安全性与可验证性如何保障
  • 潜在动作表征的可解释性与人类指令对齐问题
  • 自由视角合成与真实传感器数据分布的对齐差距如何缩小
  • 大规模交通知识图谱的自动构建与增量更新机制
  1. BEVFormer如何通过预定义BEV查询与时空注意力实现无需显式深度估计的统一表征?
  2. 3D场景生成综述中划分的四大范式分别是什么?各自主要优缺点?
  3. Diffusion Policy将动作生成建模为扩散过程的核心优势是什么?与传统策略学习有何不同?
  4. nuScenes Knowledge Graph试图提供何种语义表征?其主要服务于什么下游任务?
  5. 在表征学习向生成建模转变过程中,场景token与潜在动作各自解决了什么问题?

本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
foundational Visuomotor Understanding for Representation Learning of Driving Scenes 2019 auto refresh 2026-07-19 sources=arxiv
watch nuScenes Knowledge Graph – A comprehensive semantic representation of traffic scenes for trajectory prediction 2023 auto score=44
watch The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey 2025 auto refresh 2026-07-19 sources=arxiv
watch AdaWorld: Learning Adaptable World Models with Latent Actions 2025 cross-topic assign from registry title match=1 keywords; 202
recent 3D Scene Generation: A Survey 2025 auto refresh 2026-07-19 sources=arxiv
watch FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis 2025 auto score=42
watch Robotic VLA Benefits from Joint Learning with Motion Image Diffusion 2025 cross-topic assign from registry title match=1 keywords; 202
watch BEVFormer: Learning Bird’s-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers 2022 cross-topic assign from registry title match=1 keywords; 202
recent Deep learning modelling techniques: current progress, applications, advantages, and challenges 2023 auto refresh 2026-07-19 sources=openalex
recent Generative artificial intelligence: a systematic review and applications 2024 auto refresh 2026-07-19 sources=openalex
foundational A generative model for inorganic materials design 2025 auto refresh 2026-07-19 sources=openalex
recent Opportunities and challenges of diffusion models for generative AI 2024 NSR review opportunities and challenges of diffusion models
watch MUVO: A Multimodal Generative World Model for Autonomous Driving with Geometric Representations 2025 auto score=40
recent Deep Reinforcement Learning for Autonomous Driving: A Survey 2021 auto refresh 2026-07-19 sources=openalex
watch A controllable generative model for generating pavement crack images in complex scenes 2024 auto refresh 2026-07-19 sources=openalex
foundational Diffusion Policy: Visuomotor Policy Learning via Action Diffusion 2023 Diffusion Policy — generative action representation for cont

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)

Section titled “基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)”

近期重要(选题 5 · 可学习 2 · 待获取 PDF 3)

Section titled “近期重要(选题 5 · 可学习 2 · 待获取 PDF 3)”

观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)

Section titled “观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)”

成熟度 seed · 内容数 29 · 论文池 16