跳转到内容

VLM 与视觉语言理解

视觉语言模型对场景、物体与关系的理解。

类型 Topics · 更新 2026-07-20

本Topic聚焦视觉语言模型(VLM)与多模态大模型在自动驾驶与具身智能中的视觉语言理解问题:如何将图像/视频与语言指令对齐,实现场景语义理解、逻辑推理、指令跟随与高阶规划,弥合传统模块化感知的刚性接口与端到端轨迹预测的常识缺失。通过预训练多模态LLM、视觉指令微调与链式思考,将网络知识迁移至机器人控制与驾驶决策,支撑开放场景下的泛化理解与动作生成,服务E2E自动驾驶与具身操作。

  • 不深入纯语言模型推理细节或非视觉文本任务
  • 不覆盖传统非语言多模态融合的具体传感器标定算法
  • 不提供具体控制系统实现或硬件部署指南
  • 不讨论非VLM的纯视觉检测跟踪指标优化
  • foundations — 需掌握基础深度学习、注意力机制与预训练范式,以理解VLM的视觉编码器与语言解码器对齐
  • llm-language-reasoning — 依赖LLM的指令微调与链式思考能力,作为多模态扩展的语言底座
  • ad-end-to-end-driving — 理解端到端驾驶规划与感知接口,便于桥接VLM高阶理解与低阶轨迹输出
术语 含义 常见混淆
Vision-Language Model (VLM) 联合处理图像/视频与自然语言的多模态模型,实现跨模态对齐与生成 常与纯视觉模型混淆;VLM强调语言交互与指令跟随,而非仅分类检测
Multimodal LLM / Large Multimodal Model (MLLM) 以大语言模型为底座,接入视觉编码器后支持图像文本联合推理的模型 与早期双塔检索模型不同;现代MLLM多为生成式且支持对话
Visual Instruction Tuning 用图像-指令-回答数据对多模态模型进行指令微调,提升视觉问答与跟随能力 不同于纯语言指令微调;需处理视觉token注入与对齐损失
Vision-Language-Action (VLA) 在VLM基础上输出机器人动作或控制信号的模型,将理解转化为具身行为 非纯理解模型;强调动作空间离散化或连续输出,常与E2E驾驶轨迹关联
Embodied Multimodal Language Model 将多模态输入(视觉、本体感觉等)与语言结合,支持具身推理与决策的模型,如PaLM-E 与桌面VLM不同;强调机器人状态与物理交互闭环
Scene Understanding 对驾驶或机器人场景进行语义解析、关系推理与可导航空间描述 不止目标检测;包含逻辑关系、因果与指令相关理解
Chain-of-Thought (CoT) in Visual Context 在视觉输入下引导模型逐步推理生成中间步骤,提升复杂逻辑与规划 纯语言CoT扩展;视觉版需对齐图像证据与文本步骤

早期依赖手工特征或模块化检测-跟踪-规划流水线,接口刚性且缺乏常识。随后出现视觉-语言预训练与指令微调,使模型可直接对话式理解场景。再进一步,VLM扩展为VLA或具身多模态模型,将网络知识迁移至机器人动作与驾驶轨迹,形成高阶语言规划与低阶控制解耦或一体化范式,支持开放世界泛化。

  1. PaLM-E: An Embodied Multimodal Language Model(精读)— 奠基性工作,展示如何将多模态输入注入LLM实现具身推理与控制,桥接VLM与机器人
  2. Vision Language Models in Autonomous Driving: A Survey and Outlook(精读)— 系统梳理VLM在自动驾驶中的应用、挑战与展望,覆盖理解到规划全链路
  3. OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving(中文笔记)— 开源复现闭源EMMA思路,结合预训练MLLM与CoT实现E2E规划与感知,便于社区扩展
  1. 先读PaLM-E建立具身多模态与知识迁移基础概念
  2. 再读自动驾驶VLM综述把握领域全景与驾驶特定挑战
  3. 结合OpenEMMA与Senna笔记理解开源E2E实现与LVLM-E2E桥接设计
  4. 扩展阅读LLaVA系列与缩放实证研究掌握高效微调与压缩
  5. 最后浏览VLA与机器人视觉综述把握操作与融合前沿
Paper 输入 输出 表示 训练目标
PaLM-E: An Embodied Multimodal Language Model 多模态传感器(视觉等)+语言指令 具身动作/决策序列 连续状态嵌入注入LLM 端到端具身推理与控制
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving 驾驶图像/视频 + 任务指令 轨迹(速度曲率积分)+ 3D检测 预训练MLLM + CoT 开源E2E规划与感知
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving 场景图像 + 规划导向QA 自然语言高阶元动作 + 条件低阶轨迹 LVLM解耦 + E2E条件生成 常识推理与精确规划融合
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control 视觉观测 + 语言指令 机器人动作token VLA统一序列建模 网络知识迁移至控制
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token 图像/视频 + 文本 多模态对话/理解 单视觉token高效压缩 轻量高效LMM
  • 视觉token数量膨胀导致推理延迟与内存瓶颈,需压缩如单token设计
  • 指令微调数据偏差引发幻觉或驾驶场景常识错误
  • 开源与闭源模型能力差距,复现时对齐质量与安全边界难保证
  • 多模态对齐不充分导致视觉证据与语言推理脱节
  • E2E轨迹输出与高阶规划解耦时接口误差累积
  • 真实驾驶分布偏移下泛化失败与安全风险
  • 如何更高效地将大规模网络VLM知识无缝迁移至实时驾驶/机器人动作空间?
  • 视觉逻辑推理基准(如LogicVista)如何更好指导驾驶特定安全决策?
  • 单体VLA与层次化规划架构在开放场景下的可扩展性与可解释性权衡?
  • 轻量VLM(如LLaVA-Mini/Gemma)在车载算力下如何保持高阶理解精度?
  • 多模态融合与VLM如何互补解决遮挡、长尾与动态交互理解?
  1. PaLM-E如何将多模态输入注入语言模型实现具身能力?其与纯桌面VLM的主要区别是什么?
  2. 视觉指令微调与传统监督视觉任务训练的核心差异是什么?为何对场景理解重要?
  3. Senna如何解耦LVLM高阶元动作与E2E低阶轨迹?该设计解决了什么痛点?
  4. OpenEMMA采用什么机制生成轨迹?其开源价值相对于闭源EMMA体现在何处?
  5. 当前VLA模型在机器人操作或驾驶中面临的主要泛化挑战有哪些?可从综述中归纳。

本 Topic registry 入选 13 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
watch RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control 2023 cross-topic assign from registry title match=1 keywords; 202
recent An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models 2023 auto refresh 2026-07-19 sources=arxiv
recent LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language Model 2024 auto refresh 2026-07-19 sources=arxiv
watch OpenVLA: An Open-Source Vision-Language-Action Model 2024 cross-topic assign from registry title match=1 keywords; 202
foundational LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts 2024 auto refresh 2026-07-19 sources=arxiv
recent OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving 2024 auto refresh 2026-07-19 sources=arxiv
foundational LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token 2025 auto refresh 2026-07-19 sources=arxiv
watch Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision 2025 cross-topic assign from registry title match=1 keywords; 202
watch Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey 2025 cross-topic assign from registry title match=2 keywords; 202
watch LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration 2026 auto refresh 2026-07-19 sources=arxiv
recent Vision Language Models in Autonomous Driving: A Survey and Outlook 2024 TIV 2024 survey Vision Language Models in Autonomous Driving
foundational PaLM-E: An Embodied Multimodal Language Model 2023 PaLM-E — embodied multimodal language model; bridges VLM and
recent Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving 2024 Senna bridges large VLMs and E2E autonomous driving

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)

Section titled “基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)”

近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)

Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”

观察清单(选题 5 · 可学习 5 · 待获取 PDF 0)

Section titled “观察清单(选题 5 · 可学习 5 · 待获取 PDF 0)”

成熟度 seed · 内容数 13 · 论文池 13