VLA 模型
VLA 模型
Section titled “VLA 模型”视觉-语言-动作模型,端到端映射感知与指令到动作。
类型 Topics · 更新 2026-07-20
本 Topic 要解决什么
Section titled “本 Topic 要解决什么”本Topic聚焦Vision-Language-Action(VLA)模型,解决如何将大规模视觉语言模型(VLM)的网页/互联网知识与语义推理能力,直接迁移并 grounding 到机器人低层闭环控制与操作策略的问题。传统机器人策略依赖预定义任务规格、刚性控制器或小规模专用数据,难以在非结构化场景、新颖物体/指令与开世界条件下实现泛化与可扩展性。VLA通过将动作表示为离散token或连续控制,与视觉-语言预训练联合微调,使单一端到端模型既能理解自然语言指令与场景,又能输出机器人可执行动作(如末端执行器指令),从而打通高层语义到低层控制的闭环。核心挑战包括知识迁移效率、多机器人/多实施例适配、数据效率、实时推理与物理可行性。结合RT-1/RT-2奠定的Transformer策略与VLM co-finetune范式、OpenVLA开源基线、TinyVLA效率方向及后续移动操作迁移与综述,本Topic系统梳理VLA定义、单体/层次架构、训练范式与工程落地路径,推动具身智能从规划走向可部署的通用操作策略。
非目标 / 边界
Section titled “非目标 / 边界”- 不深入覆盖纯视觉伺服或经典模型预测控制细节
- 不讨论非视觉-语言 grounding 的专用机器人强化学习算法
- 不提供完整硬件驱动实现或特定机器人标定流程
- 不编造未给出的实验数值或性能指标
embodied-foundation-models— VLA是具身基础模型向动作输出的自然延伸,需理解VLM预训练与多模态对齐基础robot-manipulation— VLA最终服务于操作任务,需掌握机械臂控制、轨迹与可达性等基本问题设定foundations— 需具备Transformer、token化与多模态预训练的基本概念
| 术语 | 含义 | 常见混淆 |
|---|---|---|
| VLA | Vision-Language-Action模型,将视觉输入、语言指令与机器人动作统一建模的端到端策略 | 易与纯VLM(无动作输出)或传统IL/RL策略混淆;VLA强调动作token化或连续输出与VLM共训 |
| 动作token化 | 将连续机器人动作(如笛卡尔位姿、关节角)离散化为文本token,以便与VLM的语言建模目标对齐 | 与连续动作头或扩散策略输出方式不同;token化便于知识迁移但可能损失精度 |
| co-fine-tune / 联合微调 | 在机器人轨迹数据与网络规模VQA/视觉-语言任务上共同微调预训练VLM,实现知识迁移 | 不同于纯机器人微调或从零训练;关键是保留语义能力同时学习控制 |
| 单体VLA vs 层次化VLA | 单体为单/双系统直接输出低层动作;层次化则分离高层规划与低层控制 | 综述中明确分类,单体更端到端但推理与泛化权衡不同 |
| Open X-Embodiment | 多机器人多实施例大规模轨迹数据集,支撑通用VLA训练与跨机器人迁移 | 常作为OpenVLA等开源VLA的训练数据来源,注意与单机器人数据的差异 |
| 参数高效微调 | 在消费级硬件上将预训练VLA适配新机器人/任务/环境的高效方法(如LoRA等) | OpenVLA强调此实践,区别于全量重训 |
方法谱系与时间线
Section titled “方法谱系与时间线”从RT-1的Robotics Transformer大规模真实世界控制,到RT-2将网络规模VLM直接co-fine-tune为端到端VLA并动作token化,实现网页知识向机器人闭环迁移与涌现推理。随后OpenVLA提供7B全开源基线与多机器人适配实践,TinyVLA等转向数据高效与快速推理。范式从专用小规模策略转向统一视觉-语言-动作基础模型,并进一步向移动操作迁移、实时运行与健康感知等方向扩展。
- (2023) foundational — RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- (2023) foundational — RT-1: Robotics Transformer for Real-World Control at Scale
- (2024) recent — OpenVLA: An Open-Source Vision-Language-Action Model
- (2025) foundational — TinyVLA: Toward Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- (2025) watch — Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- (2025) watch — Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
- (2025) recent — Running VLAs at Real-time Speed
- (2025) recent — Robotic VLA Benefits from Joint Learning with Motion Image Diffusion
- (2025) watch — Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- (2025) watch — MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation
- (2026) recent — IROSA: Interactive Robot Skill Adaptation using Natural Language
- (2026) watch — StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing
- (2026) recent — Health-Conditioned Vision-Language-Action Models for Malfunction-Aware Robot Control
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control(中文笔记)— 奠定VLA核心范式:动作token化+VLM联合微调,展示知识迁移、新颖泛化与涌现语义推理,是从规划到低层控制的关键奠基工作
- OpenVLA: An Open-Source Vision-Language-Action Model(中文笔记)— 提供全开源(数据/权重/代码)7B通用操作策略基线,支持多机器人开箱与参数高效微调,填补闭源空白并成为标准开放对照
- RT-1: Robotics Transformer for Real-World Control at Scale(精读)— VLA前身:大规模真实世界机器人Transformer策略,为后续VLM融合与动作建模提供数据与架构基础
推荐阅读路径
Section titled “推荐阅读路径”- 先读RT-1理解大规模机器人Transformer与真实世界控制设定
- 精读RT-2掌握动作token化、VLM co-fine-tune与知识迁移机制(结合中文笔记)
- 阅读OpenVLA了解开源实现、视觉编码器融合、多机器人训练与高效微调实践(结合中文笔记)
- 浏览Large VLM-based VLA Survey把握单体/层次架构分类、数据集与开放挑战
- 选读TinyVLA关注效率与数据高效方向,MoManipVLA理解向移动操作迁移
- 结合综述与近期实时/扩散/交互工作梳理工程风险与开放问题
| Paper | 输入 | 输出 | 表示 | 训练目标 |
|---|---|---|---|---|
| RT-2 | 图像+语言指令+(可选)历史 | 离散动作token(可解码为低层控制) | 预训练VLM + 动作token化联合微调 | 网页知识迁移到机器人闭环控制与泛化 |
| OpenVLA | 视觉观测+语言指令 | 机器人动作(多实施例) | Llama 2 + DINOv2+SigLIP融合视觉编码器 | 开源通用多机器人操作策略与高效微调 |
| RT-1 | 图像序列+语言 | 动作(真实世界控制) | Robotics Transformer | 大规模真实世界机器人控制策略 |
| MoManipVLA | 预训练固定基座VLA + 移动场景指令 | 末端路点 + 基座/臂联合轨迹 | VLA路点生成 + 双层轨迹优化 | 固定基座VLA向通用移动操作迁移 |
| TinyVLA | — | — | — | 快速、数据高效的VLA操作模型 |
工程实现与复现风险
Section titled “工程实现与复现风险”- 动作token化导致精度损失或执行抖动,需与连续头/后处理平衡
- 实时推理延迟:大VLM难以满足高频控制,需量化、蒸馏或分层
- 跨机器人/实施例迁移数据稀缺与分布偏移,微调不稳定
- 物理可行性不足:生成动作可能碰撞或不可达,需规划层或约束
- 开源权重与闭源差距、数据版权与安全对齐风险
- 长程任务中累积误差与语义-控制脱节
- 如何在保持语义涌现的同时提升低层控制精度与实时性?
- 单体端到端与层次化架构在开世界泛化与可解释性上的最优权衡?
- 数据高效与少样本适配新机器人/任务的通用方法?
- 移动基座+操作、多机器人协作与健康/故障感知如何统一进VLA?
- 与扩散/生成式动作、世界模型结合的下一代范式?
- 大规模评测基准与真实家庭/服务场景可复现性如何建立?
Topic 自测清单
Section titled “Topic 自测清单”- RT-2如何通过动作token化将VLM知识迁移到机器人低层控制?其与纯VLM的核心区别是什么?
- OpenVLA采用了哪些视觉编码器融合与基座模型?它解决了闭源VLA的哪些采用障碍?
- 单体VLA与层次化VLA的主要架构差异及各自优势是什么?(参考综述分类)
- 从RT-1到RT-2再到OpenVLA,VLA范式在数据、开源与知识迁移上经历了哪些关键转变?
- 将固定基座VLA迁移到移动操作时,MoManipVLA采用了什么双层优化思路来保证物理可行轨迹?
选篇附录(registry)
Section titled “选篇附录(registry)”本 Topic registry 入选 13 篇(foundational/recent/watch 见 papers.yml)。
论文池(FRW)
Section titled “论文池(FRW)”来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5。
可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。
基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)
Section titled “基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)”- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (2023) · 固定 · 精读
- RT-1: Robotics Transformer for Real-World Control at Scale (2023) · 待获取 PDF
- TinyVLA: Toward Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation (2025) · 待获取 PDF
近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)
Section titled “近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)”- OpenVLA: An Open-Source Vision-Language-Action Model (2024) · 固定 · 精读
- Health-Conditioned Vision-Language-Action Models for Malfunction-Aware Robot Control (2026) · 中文笔记
- IROSA: Interactive Robot Skill Adaptation using Natural Language (2026) · 中文笔记
- Running VLAs at Real-time Speed (2025) · 中文笔记
- Robotic VLA Benefits from Joint Learning with Motion Image Diffusion (2025) · 中文笔记
观察清单(选题 5 · 可学习 5 · 待获取 PDF 0)
Section titled “观察清单(选题 5 · 可学习 5 · 待获取 PDF 0)”- StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing (2026) · 中文笔记
- MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation (2025) · 中文笔记
- Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey (2025) · 中文笔记
- Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review (2025) · 中文笔记
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications (2025) · 中文笔记
成熟度 developing · 内容数 14 · 论文池 13