VLM 与视觉语言理解
VLM 与视觉语言理解
Section titled “VLM 与视觉语言理解”视觉语言模型对场景、物体与关系的理解。
类型 Topics · 更新 2026-07-20
本 Topic 要解决什么
Section titled “本 Topic 要解决什么”本Topic聚焦视觉语言模型(VLM)与多模态大模型在自动驾驶与具身智能中的视觉语言理解问题:如何将图像/视频与语言指令对齐,实现场景语义理解、逻辑推理、指令跟随与高阶规划,弥合传统模块化感知的刚性接口与端到端轨迹预测的常识缺失。通过预训练多模态LLM、视觉指令微调与链式思考,将网络知识迁移至机器人控制与驾驶决策,支撑开放场景下的泛化理解与动作生成,服务E2E自动驾驶与具身操作。
非目标 / 边界
Section titled “非目标 / 边界”- 不深入纯语言模型推理细节或非视觉文本任务
- 不覆盖传统非语言多模态融合的具体传感器标定算法
- 不提供具体控制系统实现或硬件部署指南
- 不讨论非VLM的纯视觉检测跟踪指标优化
foundations— 需掌握基础深度学习、注意力机制与预训练范式,以理解VLM的视觉编码器与语言解码器对齐llm-language-reasoning— 依赖LLM的指令微调与链式思考能力,作为多模态扩展的语言底座ad-end-to-end-driving— 理解端到端驾驶规划与感知接口,便于桥接VLM高阶理解与低阶轨迹输出
| 术语 | 含义 | 常见混淆 |
|---|---|---|
| Vision-Language Model (VLM) | 联合处理图像/视频与自然语言的多模态模型,实现跨模态对齐与生成 | 常与纯视觉模型混淆;VLM强调语言交互与指令跟随,而非仅分类检测 |
| Multimodal LLM / Large Multimodal Model (MLLM) | 以大语言模型为底座,接入视觉编码器后支持图像文本联合推理的模型 | 与早期双塔检索模型不同;现代MLLM多为生成式且支持对话 |
| Visual Instruction Tuning | 用图像-指令-回答数据对多模态模型进行指令微调,提升视觉问答与跟随能力 | 不同于纯语言指令微调;需处理视觉token注入与对齐损失 |
| Vision-Language-Action (VLA) | 在VLM基础上输出机器人动作或控制信号的模型,将理解转化为具身行为 | 非纯理解模型;强调动作空间离散化或连续输出,常与E2E驾驶轨迹关联 |
| Embodied Multimodal Language Model | 将多模态输入(视觉、本体感觉等)与语言结合,支持具身推理与决策的模型,如PaLM-E | 与桌面VLM不同;强调机器人状态与物理交互闭环 |
| Scene Understanding | 对驾驶或机器人场景进行语义解析、关系推理与可导航空间描述 | 不止目标检测;包含逻辑关系、因果与指令相关理解 |
| Chain-of-Thought (CoT) in Visual Context | 在视觉输入下引导模型逐步推理生成中间步骤,提升复杂逻辑与规划 | 纯语言CoT扩展;视觉版需对齐图像证据与文本步骤 |
方法谱系与时间线
Section titled “方法谱系与时间线”早期依赖手工特征或模块化检测-跟踪-规划流水线,接口刚性且缺乏常识。随后出现视觉-语言预训练与指令微调,使模型可直接对话式理解场景。再进一步,VLM扩展为VLA或具身多模态模型,将网络知识迁移至机器人动作与驾驶轨迹,形成高阶语言规划与低阶控制解耦或一体化范式,支持开放世界泛化。
- (2023) foundational — PaLM-E: An Embodied Multimodal Language Model
- (2023) watch — RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- (2023) recent — An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models
- (2024) foundational — LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
- (2024) recent — LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language Model
- (2024) watch — OpenVLA: An Open-Source Vision-Language-Action Model
- (2024) recent — OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
- (2024) recent — Vision Language Models in Autonomous Driving: A Survey and Outlook
- (2024) recent — Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
- (2025) foundational — LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
- (2025) watch — Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
- (2025) watch — Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
- (2026) watch — LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
- PaLM-E: An Embodied Multimodal Language Model(精读)— 奠基性工作,展示如何将多模态输入注入LLM实现具身推理与控制,桥接VLM与机器人
- Vision Language Models in Autonomous Driving: A Survey and Outlook(精读)— 系统梳理VLM在自动驾驶中的应用、挑战与展望,覆盖理解到规划全链路
- OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving(中文笔记)— 开源复现闭源EMMA思路,结合预训练MLLM与CoT实现E2E规划与感知,便于社区扩展
推荐阅读路径
Section titled “推荐阅读路径”- 先读PaLM-E建立具身多模态与知识迁移基础概念
- 再读自动驾驶VLM综述把握领域全景与驾驶特定挑战
- 结合OpenEMMA与Senna笔记理解开源E2E实现与LVLM-E2E桥接设计
- 扩展阅读LLaVA系列与缩放实证研究掌握高效微调与压缩
- 最后浏览VLA与机器人视觉综述把握操作与融合前沿
| Paper | 输入 | 输出 | 表示 | 训练目标 |
|---|---|---|---|---|
| PaLM-E: An Embodied Multimodal Language Model | 多模态传感器(视觉等)+语言指令 | 具身动作/决策序列 | 连续状态嵌入注入LLM | 端到端具身推理与控制 |
| OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving | 驾驶图像/视频 + 任务指令 | 轨迹(速度曲率积分)+ 3D检测 | 预训练MLLM + CoT | 开源E2E规划与感知 |
| Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving | 场景图像 + 规划导向QA | 自然语言高阶元动作 + 条件低阶轨迹 | LVLM解耦 + E2E条件生成 | 常识推理与精确规划融合 |
| RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control | 视觉观测 + 语言指令 | 机器人动作token | VLA统一序列建模 | 网络知识迁移至控制 |
| LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token | 图像/视频 + 文本 | 多模态对话/理解 | 单视觉token高效压缩 | 轻量高效LMM |
工程实现与复现风险
Section titled “工程实现与复现风险”- 视觉token数量膨胀导致推理延迟与内存瓶颈,需压缩如单token设计
- 指令微调数据偏差引发幻觉或驾驶场景常识错误
- 开源与闭源模型能力差距,复现时对齐质量与安全边界难保证
- 多模态对齐不充分导致视觉证据与语言推理脱节
- E2E轨迹输出与高阶规划解耦时接口误差累积
- 真实驾驶分布偏移下泛化失败与安全风险
- 如何更高效地将大规模网络VLM知识无缝迁移至实时驾驶/机器人动作空间?
- 视觉逻辑推理基准(如LogicVista)如何更好指导驾驶特定安全决策?
- 单体VLA与层次化规划架构在开放场景下的可扩展性与可解释性权衡?
- 轻量VLM(如LLaVA-Mini/Gemma)在车载算力下如何保持高阶理解精度?
- 多模态融合与VLM如何互补解决遮挡、长尾与动态交互理解?
Topic 自测清单
Section titled “Topic 自测清单”- PaLM-E如何将多模态输入注入语言模型实现具身能力?其与纯桌面VLM的主要区别是什么?
- 视觉指令微调与传统监督视觉任务训练的核心差异是什么?为何对场景理解重要?
- Senna如何解耦LVLM高阶元动作与E2E低阶轨迹?该设计解决了什么痛点?
- OpenEMMA采用什么机制生成轨迹?其开源价值相对于闭源EMMA体现在何处?
- 当前VLA模型在机器人操作或驾驶中面临的主要泛化挑战有哪些?可从综述中归纳。
选篇附录(registry)
Section titled “选篇附录(registry)”本 Topic registry 入选 13 篇(foundational/recent/watch 见 papers.yml)。
论文池(FRW)
Section titled “论文池(FRW)”来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5。
可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。
基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)
Section titled “基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)”- LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts (2024) · 中文笔记
- LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token (2025) · 中文笔记
- PaLM-E: An Embodied Multimodal Language Model (2023) · 待获取 PDF
近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)
Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”- Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving (2024) · 固定 · 中文笔记
- OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving (2024) · 中文笔记
- LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language Model (2024) · 中文笔记
- An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models (2023) · 中文笔记
- Vision Language Models in Autonomous Driving: A Survey and Outlook (2024) · 待获取 PDF
观察清单(选题 5 · 可学习 5 · 待获取 PDF 0)
Section titled “观察清单(选题 5 · 可学习 5 · 待获取 PDF 0)”- LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration (2026) · 中文笔记
- Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey (2025) · 中文笔记
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (2023) · 精读
- OpenVLA: An Open-Source Vision-Language-Action Model (2024) · 精读
- Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision (2025) · 中文笔记
成熟度 seed · 内容数 13 · 论文池 13