跳转到内容

VLA 模型

视觉-语言-动作模型,端到端映射感知与指令到动作。

类型 Topics · 更新 2026-07-20

本Topic聚焦Vision-Language-Action(VLA)模型,解决如何将大规模视觉语言模型(VLM)的网页/互联网知识与语义推理能力,直接迁移并 grounding 到机器人低层闭环控制与操作策略的问题。传统机器人策略依赖预定义任务规格、刚性控制器或小规模专用数据,难以在非结构化场景、新颖物体/指令与开世界条件下实现泛化与可扩展性。VLA通过将动作表示为离散token或连续控制,与视觉-语言预训练联合微调,使单一端到端模型既能理解自然语言指令与场景,又能输出机器人可执行动作(如末端执行器指令),从而打通高层语义到低层控制的闭环。核心挑战包括知识迁移效率、多机器人/多实施例适配、数据效率、实时推理与物理可行性。结合RT-1/RT-2奠定的Transformer策略与VLM co-finetune范式、OpenVLA开源基线、TinyVLA效率方向及后续移动操作迁移与综述,本Topic系统梳理VLA定义、单体/层次架构、训练范式与工程落地路径,推动具身智能从规划走向可部署的通用操作策略。

  • 不深入覆盖纯视觉伺服或经典模型预测控制细节
  • 不讨论非视觉-语言 grounding 的专用机器人强化学习算法
  • 不提供完整硬件驱动实现或特定机器人标定流程
  • 不编造未给出的实验数值或性能指标
  • embodied-foundation-models — VLA是具身基础模型向动作输出的自然延伸,需理解VLM预训练与多模态对齐基础
  • robot-manipulation — VLA最终服务于操作任务,需掌握机械臂控制、轨迹与可达性等基本问题设定
  • foundations — 需具备Transformer、token化与多模态预训练的基本概念
术语 含义 常见混淆
VLA Vision-Language-Action模型,将视觉输入、语言指令与机器人动作统一建模的端到端策略 易与纯VLM(无动作输出)或传统IL/RL策略混淆;VLA强调动作token化或连续输出与VLM共训
动作token化 将连续机器人动作(如笛卡尔位姿、关节角)离散化为文本token,以便与VLM的语言建模目标对齐 与连续动作头或扩散策略输出方式不同;token化便于知识迁移但可能损失精度
co-fine-tune / 联合微调 在机器人轨迹数据与网络规模VQA/视觉-语言任务上共同微调预训练VLM,实现知识迁移 不同于纯机器人微调或从零训练;关键是保留语义能力同时学习控制
单体VLA vs 层次化VLA 单体为单/双系统直接输出低层动作;层次化则分离高层规划与低层控制 综述中明确分类,单体更端到端但推理与泛化权衡不同
Open X-Embodiment 多机器人多实施例大规模轨迹数据集,支撑通用VLA训练与跨机器人迁移 常作为OpenVLA等开源VLA的训练数据来源,注意与单机器人数据的差异
参数高效微调 在消费级硬件上将预训练VLA适配新机器人/任务/环境的高效方法(如LoRA等) OpenVLA强调此实践,区别于全量重训

从RT-1的Robotics Transformer大规模真实世界控制,到RT-2将网络规模VLM直接co-fine-tune为端到端VLA并动作token化,实现网页知识向机器人闭环迁移与涌现推理。随后OpenVLA提供7B全开源基线与多机器人适配实践,TinyVLA等转向数据高效与快速推理。范式从专用小规模策略转向统一视觉-语言-动作基础模型,并进一步向移动操作迁移、实时运行与健康感知等方向扩展。

  1. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control(中文笔记)— 奠定VLA核心范式:动作token化+VLM联合微调,展示知识迁移、新颖泛化与涌现语义推理,是从规划到低层控制的关键奠基工作
  2. OpenVLA: An Open-Source Vision-Language-Action Model(中文笔记)— 提供全开源(数据/权重/代码)7B通用操作策略基线,支持多机器人开箱与参数高效微调,填补闭源空白并成为标准开放对照
  3. RT-1: Robotics Transformer for Real-World Control at Scale(精读)— VLA前身:大规模真实世界机器人Transformer策略,为后续VLM融合与动作建模提供数据与架构基础
  1. 先读RT-1理解大规模机器人Transformer与真实世界控制设定
  2. 精读RT-2掌握动作token化、VLM co-fine-tune与知识迁移机制(结合中文笔记)
  3. 阅读OpenVLA了解开源实现、视觉编码器融合、多机器人训练与高效微调实践(结合中文笔记)
  4. 浏览Large VLM-based VLA Survey把握单体/层次架构分类、数据集与开放挑战
  5. 选读TinyVLA关注效率与数据高效方向,MoManipVLA理解向移动操作迁移
  6. 结合综述与近期实时/扩散/交互工作梳理工程风险与开放问题
Paper 输入 输出 表示 训练目标
RT-2 图像+语言指令+(可选)历史 离散动作token(可解码为低层控制) 预训练VLM + 动作token化联合微调 网页知识迁移到机器人闭环控制与泛化
OpenVLA 视觉观测+语言指令 机器人动作(多实施例) Llama 2 + DINOv2+SigLIP融合视觉编码器 开源通用多机器人操作策略与高效微调
RT-1 图像序列+语言 动作(真实世界控制) Robotics Transformer 大规模真实世界机器人控制策略
MoManipVLA 预训练固定基座VLA + 移动场景指令 末端路点 + 基座/臂联合轨迹 VLA路点生成 + 双层轨迹优化 固定基座VLA向通用移动操作迁移
TinyVLA 快速、数据高效的VLA操作模型
  • 动作token化导致精度损失或执行抖动,需与连续头/后处理平衡
  • 实时推理延迟:大VLM难以满足高频控制,需量化、蒸馏或分层
  • 跨机器人/实施例迁移数据稀缺与分布偏移,微调不稳定
  • 物理可行性不足:生成动作可能碰撞或不可达,需规划层或约束
  • 开源权重与闭源差距、数据版权与安全对齐风险
  • 长程任务中累积误差与语义-控制脱节
  • 如何在保持语义涌现的同时提升低层控制精度与实时性?
  • 单体端到端与层次化架构在开世界泛化与可解释性上的最优权衡?
  • 数据高效与少样本适配新机器人/任务的通用方法?
  • 移动基座+操作、多机器人协作与健康/故障感知如何统一进VLA?
  • 与扩散/生成式动作、世界模型结合的下一代范式?
  • 大规模评测基准与真实家庭/服务场景可复现性如何建立?
  1. RT-2如何通过动作token化将VLM知识迁移到机器人低层控制?其与纯VLM的核心区别是什么?
  2. OpenVLA采用了哪些视觉编码器融合与基座模型?它解决了闭源VLA的哪些采用障碍?
  3. 单体VLA与层次化VLA的主要架构差异及各自优势是什么?(参考综述分类)
  4. 从RT-1到RT-2再到OpenVLA,VLA范式在数据、开源与知识迁移上经历了哪些关键转变?
  5. 将固定基座VLA迁移到移动操作时,MoManipVLA采用了什么双层优化思路来保证物理可行轨迹?

本 Topic registry 入选 13 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
foundational RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control 2023 RT-2 (2023) — vision-language-action transfer from web-scale
recent OpenVLA: An Open-Source Vision-Language-Action Model 2024 OpenVLA — open-source VLA; standard open baseline post RT-2
watch Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review 2025 auto refresh 2026-07-19 sources=arxiv
watch Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey 2025 cross-topic assign from registry title match=1 keywords; 202
recent Running VLAs at Real-time Speed 2025 auto refresh 2026-07-19 sources=arxiv
recent Robotic VLA Benefits from Joint Learning with Motion Image Diffusion 2025 auto refresh 2026-07-19 sources=arxiv
recent IROSA: Interactive Robot Skill Adaptation using Natural Language 2026 auto refresh 2026-07-19 sources=arxiv
watch StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing 2026 cross-topic assign from registry title match=2 keywords; 202
recent Health-Conditioned Vision-Language-Action Models for Malfunction-Aware Robot Control 2026 auto refresh 2026-07-19 sources=arxiv
watch Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications 2025 auto refresh 2026-07-19 sources=openalex,crossref
watch MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation 2025 cross-topic assign from registry title match=2 keywords; 202
foundational TinyVLA: Toward Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation 2025 auto refresh 2026-07-19 sources=openalex
foundational RT-1: Robotics Transformer for Real-World Control at Scale 2023 RSS 2023 RT-1 — robotics transformer for real-world control

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)

Section titled “基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)”

近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)

Section titled “近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)”

观察清单(选题 5 · 可学习 5 · 待获取 PDF 0)

Section titled “观察清单(选题 5 · 可学习 5 · 待获取 PDF 0)”

成熟度 developing · 内容数 14 · 论文池 13