跳转到内容

MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation

MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation

Section titled “MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation”

⚠️ AI 生成 · 建议对照原文 本页为自动整理的学习笔记;关键数据与引用如需引用,请回查 PDF / 官方版本。

学习档位 中文笔记

类型 文献 · 更新 2026-07-19

所属 机器人操作 · VLA 模型

中文学习笔记(自动生成,需核验)

Section titled “中文学习笔记(自动生成,需核验)”

Topic: robot-manipulation · Tier: recent · Year: 2025 · Venue:
Evidence level: partial · 本地全文: 是 · 建议阅读: ~35 分钟
Paper: https://arxiv.org/abs/2503.13446
Code:
Generator: grok

移动操作需要基座与机械臂协同且在非结构化大空间泛化,传统方法数据规模受限、VLA则多为固定基座。本文给出一种低成本适配框架,将预训练固定基座VLA的泛化能力迁移到移动操作,并通过物理可行轨迹规划实现零样本基座调整,对具身智能与家庭服务机器人方向有直接参考价值。

MoManipVLA通过预训练VLA生成末端执行器路点,再以可达性、平滑性、碰撞代价的双层轨迹优化联合规划移动基座与机械臂,实现固定基座VLA到通用移动操作的高效迁移。

移动操作要求机器人在大空间内基于指令与物体交互,并协同控制移动基座与机械臂生成物理可行轨迹;现有端到端或模块化方法因示范数据成本高、规模有限而泛化差,而预训练VLA虽跨任务/环境泛化强,却面向固定基座、无法直接输出基座-臂协同动作。

视觉-语言-动作(VLA)模型基本流程;移动操作中的基座-臂整机控制;运动规划中的可达性/IK、轨迹平滑与基于ESDF的碰撞代价;双层优化思想;以及OVMM等仿真基准与真实机器人部署常识。

  • 提出将预训练固定基座VLA迁移到移动操作的策略适配框架,以获得跨任务与环境的高泛化。
  • 设计面向基座与机械臂的运动规划目标(可达性、平滑性、碰撞避免),并给出双层轨迹优化框架以提升物理可行性与效率。
  • 在OVMM与真实世界实验中验证了方法的泛化与部署效率(相对SOTA更高成功率,且真实部署训练成本低)。

1)用预训练VLA根据当前RGB与本体状态预测末端执行器路点Qi,经Γ变换到世界系得到Q̂i;2)在相邻路点间用双层优化生成基座与臂的联合轨迹,目标最小化物理可行性代价O(含可达性Fr、平滑性Fs、碰撞Fc),并满足起止位姿与路点一致;3)上界优化基座路点以扩大后续操作策略空间,下界在固定基座下优化末端轨迹以完成操作;4)用Pinocchio IK求关节角,基座做平移/旋转驱动,整体使固定基座VLA策略以极低额外训练成本适配移动操作。

VLA路点生成:复用固定基座VLA的强泛化,输出末端路点引导整机运动,避免从零学习高DoF策略。运动规划目标:可达性Fr(IK迭代次数相对Nmax,超限给大常数C0)、平滑性Fs(连续关节角差与基座位姿差L2累加)、碰撞Fc(nvblox ESDF上机器人表面随机查询点的安全边距惩罚)。双层优化:上界改基座以扩大可操作空间,下界跟VLA路点优化末端;贪心但针对约10-DoF搜索空间更高效。取舍:不直接端到端学整机动作,而是“VLA指导+物理约束优化”,用可解释代价换可迁移性与低数据需求。

仿真基准为OVMM;另含真实世界实验。指标主要为任务成功率(success rate);真实部署强调少量专家回合/训练成本。具体划分、任务列表与其他指标待来源核验。

在OVMM与真实世界上,MoManipVLA相对SOTA移动操作方法成功率高4.2%;因预训练VLA泛化强,真实部署仅需约50的训练成本(专家回合量级)。其余定量消融与细节待来源核验。

双层优化为贪心近似,大搜索空间下可能非全局最优;依赖VLA路点质量与IK/ESDF精度,极端遮挡、噪声或超限姿态时可达性/碰撞代价可能失效;真实部署仍需少量专家数据;更细失败场景与边界条件待来源核验。

与前序 / 同期 / 后续方法的关系

Section titled “与前序 / 同期 / 后续方法的关系”

相对端到端模仿学习(数据贵、泛化弱)与模块化(规划+RL控制器,如Home-Robot、OK-Robot、SPIN),强调用大规模预训练VLA补泛化。相对固定基座VLA(OpenVLA、ManipLLM、TinyVLA、RDT-1B、π0等)补充基座-臂协同。轨迹优化上受ReKep/VoxPoser等基础模型约束启发,把手写/学习代价扩展到移动操作整机规划。

论文提及project homepage(摘录中链接未完整给出)。复现建议:先复现固定基座VLA路点预测,再实现可达/平滑/碰撞代价与双层优化(上界基座、下界末端),用Pinocchio IK与nvblox ESDF;在OVMM验证后以少量真实专家回合微调。具体代码仓库与超参待来源核验。

先读摘要与图1理解动机与整体效果;再读第1节引言与贡献;第3.1–3.2问题与迁移框架;第3.3三个规划目标(公式1–5);第3.4双层优化与算法1;最后第2节相关工作与实验声明(结果细节待全文)。

  1. Q: MoManipVLA为何不直接用端到端方式学习移动操作策略? A: 高DoF示范采集成本高、数据规模有限导致泛化差;而预训练固定基座VLA已有跨任务/环境泛化,通过路点+物理可行规划迁移更高效。
  2. Q: 双层轨迹优化中上界与下界分别优化什么? A: 上界优化基座运动/路点以增强后续机械臂策略空间;下界在给定基座下选择最优末端执行器轨迹以跟随VLA路点完成操作。
  3. Q: 可达性代价Fr如何定义? A: 若IK在Nmax迭代内求得解则Fr=NIK/Nmax,否则取大常数C0,反映位姿是否可达及是否接近关节极限。
  4. Q: 碰撞代价如何计算? A: 用nvblox由RGB-D建ESDF,在机器人表面随机采样Nq个查询点,对轨迹上各时刻的安全边距违规做max(0, ϵ0−D)累加惩罚。
  5. Q: 文中报告的主要定量结果是什么? A: 相对SOTA移动操作成功率高4.2%;真实部署因VLA泛化仅需约50训练成本(专家回合量级)。
  • Abstract / page 1: we propose an efficient policy adaptation framework named MoManipVLA to transfer pre-trained VLA models of fix-base manipulation to mobile manipulation
  • Abstract / page 1: MoManipVLA achieves a 4.2% higher success rate than the state-of-the-art mobile manipulation, and only requires 50 training cost for real world deployment
  • Section 1 Introduction / contributions: We propose a policy adaptation framework that transfers pre-trained VLA models for mobile manipulation, enabling high generalization across tasks and environments.
  • Section 3.3 / Reachability cost: Fr = NIK / Nmax if NIK ⩽ Nmax, C0 if NIK > Nmax
  • Section 3.4 Bi-Level Trajectory Optimization: the upper level optimizes the waypoints for the base to enhance the manipulator policy space, while the lower level further optimizes the waypoints for the end-effector
  • topic: robot-manipulation
  • sources: crossref, openalex
  • retrieved_at: 2026-07-20
  • query: robot manipulation foundation model
  • doi: 10.1109/cvpr52734.2025.00167
  • score_total: 53
  • suggested_tier: recent

(no prose relevance explanation — numeric score only or HTTP source)

(no snippet evidence in candidate pool)

生成:2026-07-21 · 来源条数 3 · 模型 heuristic · 需人工核验数字

围绕「MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation」的核心问题与动机(待结合全文核验)。

  • 见原文方法章节;以下为基于摘要/摘录的要点提示。
  • MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation …

与相近工作的关系待核验;请对照 related work。

  • 勿仅凭摘要推断未给出的数值指标。
  1. 这篇工作的输入/输出表示是什么?(MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation)
  2. 训练目标与评测协议各是什么?
  3. 主要失败模式或局限是什么?
flowchart LR
A["输入 / 观测"] --> B["表示 / 编码"]
B --> C["推理 / 解码"]
C --> D["输出 / 动作或检测"]
%% method sketch for: MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipu

方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。

MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation arch p.1

来源:原论文约 p.1(arch);学习用途摘录。

MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation table p.7

来源:原论文约 p.7(table);学习用途摘录。

展开英文 Paper Card / AI deep analysis
Field Content
Year 2025
Authors Zhenyu Wu, Yuheng Zhou, Xiuwei Xu, Ziwei Wang, Haibin Yan
arXiv 2503.13446
DOI 10.1109/cvpr52734.2025.00167
Topics robot-manipulation, vla-models
Paper https://arxiv.org/abs/2503.13446
展开 Extract / Selections / Local assets
  • robot-manipulation: tier=recent rank=3 score=53 — auto refresh 2026-07-19 sources=openalex,crossref
  • vla-models: tier=watch rank=4 score=57 — cross-topic assign from registry title match=2 keywords; 2026-07-19
(no PDF text available; metadata-only card)