跳转到内容

OpenVLA: An Open-Source Vision-Language-Action Model

OpenVLA: An Open-Source Vision-Language-Action Model

Section titled “OpenVLA: An Open-Source Vision-Language-Action Model”

学习档位 精读

类型 文献 · 更新 2026-07-20

所属 VLA 模型 · VLM 与视觉语言理解

中文学习笔记(自动生成,需核验)

Section titled “中文学习笔记(自动生成,需核验)”

Topic: embodied-foundation-models · Tier: recent · Year: 2024 · Venue:
Evidence level: partial · 本地全文: 是 · 建议阅读: ~45 分钟
Paper: https://arxiv.org/abs/2406.09246
Code:
Generator: grok

OpenVLA填补了闭源VLA的空白,提供7B全开源(数据/权重/代码)通用机器人操作策略,支持多机器人开箱控制和参数高效微调,并在多样任务上超越更大闭源模型,适合具身智能与机器人基础模型研究。

OpenVLA是基于Llama 2与融合DINOv2+SigLIP视觉编码器的7B开源VLA,在970k Open X-Embodiment轨迹上训练,实现通用多机器人操作与高效微调,优于更大闭源模型。

现有视觉-语言-动作(VLA)模型大多闭源不可访问,且缺乏将VLA高效微调到新机器人、环境与任务的最佳实践,尤其是在消费级硬件上,阻碍了广泛采用与后续研究。

视觉-语言模型(VLM)架构与训练(如Llama 2、SigLIP、DINOv2、patch-as-token)、机器人模仿学习与端执行器控制、动作离散化、参数高效微调(LoRA)、量化推理,以及Open X-Embodiment等多机器人数据集基础。

  • 提出7B参数全开源VLA,在970k真实机器人演示上训练,支持多机器人开箱控制与快速适配。
  • 结合融合视觉编码器与数据多样性,在29个任务与多实施例上以7x更少参数超越55B RT-2-X 16.5%绝对成功率。
  • 系统研究VLA高效微调策略,在多物体多任务与语言 grounding 场景优于from-scratch方法(如Diffusion Policy 20.4%)与其他预训练策略。
  • 首次展示LoRA与量化使OpenVLA可在消费级GPU上微调与服务,且不损失下游成功率。
  • 开源模型检查点、微调notebook与可扩展PyTorch训练代码库。

以预训练Prismatic-7B VLM为骨干(融合DINOv2+SigLIP视觉编码器→MLP投影器→Llama 2 7B LLM);将图像观测与语言指令映射到机器人动作;将连续7D动作按1st-99th分位数均匀离散化为每维256 bins,覆盖Llama tokenizer最少用token;仅对动作token做next-token预测交叉熵训练;在Open X-Embodiment筛选后的970k单臂端执行器轨迹上端到端微调(含视觉编码器);支持LoRA/量化高效适配与远程推理服务。

视觉编码器:通道拼接DINOv2(空间细节)与SigLIP(语义)特征,微调对精确控制关键;MLP投影器:将视觉patch映射到LLM输入空间;Llama 2 7B:生成动作token;动作去token化器:输出Δx, Δθ, ΔGrip等7D动作。设计取舍:选用Prismatic因语言grounding与空间推理更强;224×224分辨率(更高分辨率无收益但计算×3);冻结视觉编码器效果差故必须微调;训练多epoch至动作token准确率>95%;固定LR 2e-5;分位数离散化以抗异常值。

训练:Open X-Embodiment筛选后的970k机器人episodes(单臂端执行器、至少1个第三人称相机,采用Octo混合权重平衡多样性,后期移除拟合不佳的DROID)。评估:WidowX与Google Robot多实施例共29任务成功率;微调在7个多样化操作任务(pick-and-place到清桌)上比较语言grounding与多物体场景。指标主要为绝对任务成功率;另报告消费级GPU内存与推理频率。

OpenVLA在29任务与多机器人实施例上绝对成功率比RT-2-X(55B)高16.5%,参数少7倍;微调后在多物体多任务与语言grounding场景比Diffusion Policy高20.4%,并优于微调Octo等;LoRA与量化可在消费级GPU微调/服务且不损成功率。

DROID等高度多样数据在训练中动作token准确率低,需更大混合权重或模型;提取仅覆盖部分实验细节与失败场景,完整边界与更多失败案例待来源核验;当前限制为单臂端执行器与第三人称相机,异构传感器/动作空间留待未来。

与前序 / 同期 / 后续方法的关系

Section titled “与前序 / 同期 / 后续方法的关系”

构建于VLM(CLIP/SigLIP/DINOv2/Llama/Prismatic/LLaVA/IDEFICS)与generalist策略(Octo、多任务模仿);直接继承并开源化VLA路线(RT-2/RT-2-X等闭源模型),将动作作为token端到端微调VLM;区别于模块化或定制架构方法,强调通用架构、数据混合与高效微调;优于拼接预训练组件的from-scratch或半预训练策略。

官方https://openvla.github.io;HuggingFace可下载检查点与微调;全开源PyTorch代码库支持Open X规模训练;提供微调notebook与远程推理服务器;建议从预训练Prismatic骨干开始,按文中数据混合与超参(224px、2e-5 LR、LoRA)复现,注意21,500 A100-hours训练成本,推理可用bfloat16或量化。

先读摘要与图1了解全貌与开源声明;再读引言明确问题与贡献;然后方法第3节(3.1 VLM预备→3.2训练流程→3.3数据→3.4设计决策→3.5基础设施);接着相关工作定位;最后(若有)结果与附录数据混合;重点关注动作离散化与微调实验。

  1. Q: OpenVLA的视觉编码器如何融合特征?为什么对机器人控制有帮助? A: 将DINOv2与SigLIP特征通道拼接;DINOv2提供低层空间细节,SigLIP提供高层语义,有助于空间推理与视觉泛化。
  2. Q: 动作如何 discrete 化并融入LLM词汇表? A: 每维动作按训练数据1st-99th分位数均匀分为256 bins;覆盖Llama tokenizer中最少使用的256个token。
  3. Q: 相对RT-2-X,OpenVLA的主要优势数字是什么? A: 在29任务多实施例上绝对成功率高16.5%,参数少约7倍(7B vs 55B)。
  4. Q: 为什么在VLA训练中必须微调视觉编码器,而VLM中常冻结? A: 预训练视觉骨干可能不足以捕获精确机器人控制所需的细粒度空间细节。
  5. Q: OpenVLA如何实现消费级GPU上的高效适配? A: 使用LoRA等低秩适配与模型量化,微调与推理时不损失下游成功率。
  • page 1 Abstract/Fig1: OpenVLA, a 7B-parameter open-source VLA trained on a diverse collection of 970k real-world robot demonstrations. OpenVLA builds on a Llama 2 language model combined with a visual encoder that fuses pretrained features from DINOv2 and SigLIP. … outperforming closed models such as RT-2-X (55B) by 16.5% in absolute task success rate across 29 tasks … with 7x fewer parameters.
  • page 2: fine-tuned OpenVLA shows substantial improvement on tasks involving grounding language to behavior in multi-task settings with multiple objects. … outperform expressive from-scratch imitation learning methods such as Diffusion Policy by 20.4% … fine-tuned on consumer GPUs via modern low-rank adaptation methods and served efficiently via quantization without a hit to downstream success rate.
  • page 4 Fig2 / Sec 3.1: the architecture consists of three key components: (1) a vision encoder that concatenates Dino V2 and SigLIP features, (2) a projector that maps visual features to the language embedding space, and (3) the LLM backbone, a Llama 2 7B-parameter large language model.
  • page 5 Sec 3.2: we discretize each dimension of the robot actions separately into one of 256 bins. For each action dimension, we set the bin width to uniformly divide the interval between the 1st and 99th quantile of the actions in the training data. … overwriting the 256 least used tokens in the Llama tokenizer’s vocabulary … trained with a standard next-token prediction objective, evaluating the cross-entropy loss on the predicted action tokens only.
  • page 6 Sec 3.4: fine-tuning the vision encoder during VLA training to be crucial for good VLA performance. … opt for a resolution of 224 × 224px … real robot performance continually increasing until training action token accuracy surpasses 95%. Our final training run completes 27 epochs … fixed learning rate of 2e-5.
  • topic: embodied-agents
  • sources: asta
  • retrieved_at: 2026-07-20
  • query: Find foundational and recent research papers for the topic «具身智能体» (embodied-agents). Prefer peer-reviewed or widely cited work with clear method contributions. Include open-source code when available. Exclude pure survey spam unless highly cited. Core concepts: embodied agent, foundation agent, robot agent. Search facets: embodied AI agents foundation models; vision language action agent robotics; embodied multimodal agent benchmark. Relevant venues include: CoRL, ICRA, NeurIPS, CVPR. Return pa
  • corpus_id: 270440391
  • arxiv: 2406.09246
  • relevance_score: 0.8630126551794359
  • score_total: 32
  • suggested_tier: watch

(no prose relevance explanation — numeric score only or HTTP source)

(no snippet evidence in candidate pool)

flowchart LR
A["输入 / 观测"] --> B["表示 / 编码"]
B --> C["推理 / 解码"]
C --> D["输出 / 动作或检测"]
%% method sketch for: OpenVLA: An Open-Source Vision-Language-Action Model

方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。

OpenVLA: An Open-Source Vision-Language-Action Model arch p.1

来源:原论文约 p.1(arch);学习用途摘录。

OpenVLA: An Open-Source Vision-Language-Action Model table p.7

来源:原论文约 p.7(table);学习用途摘录。

如何提供开源、可多机器人适配的 7B VLA 基线(OpenVLA),并支持参数高效微调。

工业与学术复现的共同锚点:闭源 RT 路线之后,OpenVLA 让「可跑的 VLA」成为默认对照。主路径要求读它的数据(Open X-Embodiment)、视觉编码器融合与 LoRA 适配实践。

  • 跨实施例负迁移;
  • 推理延迟;
  • 微调数据过少导致灾难性遗忘语义。
  1. 视觉编码器如何融合?
  2. 多机器人训练的数据假设?
  3. 高效微调改哪些模块?
展开英文 Paper Card / AI deep analysis
Field Content
Year 2024
Authors Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan Foster, Grace Lam, Pannag Sanketi, Quan Vuong, Thomas Kollar
arXiv 2406.09246
DOI 10.48550/arxiv.2406.09246
Topics embodied-foundation-models, vla-models, vlm-understanding
Paper https://arxiv.org/abs/2406.09246
展开 Extract / Selections / Local assets
  • embodied-foundation-models: tier=recent rank=3 score=58 — OpenVLA open foundation VLA for manipulation
  • vla-models: tier=recent rank=1 score=85 — OpenVLA — open-source VLA; standard open baseline post RT-2
  • vlm-understanding: tier=watch rank=4 score=51 — cross-topic assign from registry title match=1 keywords; 2026-07-19
OpenVLA:
An Open-Source Vision-Language-Action Model
Moo Jin Kim∗,1 Karl Pertsch∗,1,2 Siddharth Karamcheti∗,1,3
4
Ted Xiao Ashwin Balakrishna3 Suraj Nair3 Rafael Rafailov1 Ethan Foster1 Grace Lam
Pannag Sanketi4 Quan Vuong5,† Thomas Kollar3 Benjamin Burchfiel3 Russ Tedrake3,6 Dorsa Sadigh1
Sergey Levine2 Percy Liang1 Chelsea Finn1
https://openvla.github.io
Large-Scale Robot OpenVLA Closed-Loop
arXiv:2406.09246v3 [cs.RO] 5 Sep 2024
Training Data Vision-Language-Action Model Robot Control Policy
User: Wipe the table.
Fine-tune VLM w/ Robot Actions:
OpenVLA:
[Δx, Δθ, ΔGrip] = …
970k Robot
Episodes Llama 2 7B
ViT
Base VLM
Multi-Robot Control & E cient Fine-Tuning Fully