跳转到内容

具身基础模型与智能体

LLM、VLM、VLA 与具身智能体等驱动决策与交互的基础模型。

类型 Topics · 更新 2026-07-19

本 Topic 聚焦具身基础模型(embodied foundation models)与智能体,解决如何构建能将大规模视觉-语言预训练知识迁移到机器人控制的统一模型问题。核心挑战包括:从纯语言/视觉模型到可输出动作的 VLA 架构设计;用网络数据与人类视频进行可扩展预训练以降低真机采集成本;实现跨任务、跨场景甚至跨具身(如室内操作与移动服务)的泛化;以及开放模型与高效微调以支持真实世界部署。通过 RT 系列、OpenVLA、PaLM-E 等路径,探索从专用策略到 foundation-scale 预训练与后训练的范式,使机器人智能体具备语义理解与物理交互能力。

  • 不深入纯视觉-语言模型(无动作输出)的预训练细节
  • 不覆盖低层电机控制、硬件驱动或仿真引擎实现
  • 不展开非具身的通用 LLM 应用或纯导航规划算法
  • 不提供具体未给出的实验数值或超参数复现
  • vlm-understanding — 需先掌握视觉-语言模型的多模态对齐与指令跟随基础,才能理解其向动作扩展的 VLA 设计
  • vla-models — 相邻主题提供 VLA 架构与动作表示入门,本 Topic 在此基础上讨论 foundation 级预训练与跨具身扩展
  • foundations — 需要 Transformer、多模态融合与大规模预训练基本概念作为底座
术语 含义 常见混淆
Vision-Language-Action (VLA) Model 同时处理视觉输入、语言指令并直接输出机器人动作的端到端模型,是具身基础模型的核心形态 易与纯 VLM 混淆:VLM 通常只输出文本/描述,VLA 额外产生可执行动作 token 或轨迹
Embodied Foundation Model 在大规模多模态数据上预训练、可适应多种具身任务(操作、导航、服务)的通用模型,强调知识迁移与跨域泛化 与专用机器人策略不同,后者针对单一任务/机器人设计,foundation 强调规模与可迁移性
RT-2 将网络视觉-语言知识 co-fine-tune 到机器人控制的 VLA,实现语义泛化与 emergent 能力 易与 RT-1 混淆:RT-1 是大规模 Robotics Transformer 前驱,RT-2 进一步融合 web 知识
OpenVLA 开源的视觉-语言-动作基础模型,面向操作任务,强调可复现与社区可用 与闭源商业 VLA 对比时,重点在开放权重与数据协议而非绝对性能数值
Egocentric Human Video Pretraining 用第一人称人类视频作为具身预训练数据源,匹配规模下可优于或补充真机遥操作轨迹 与真机数据对比时注意后训练对齐协议:视频学表征,少量真机做动作对齐
Cross-Embodiment 统一不同具身形态(如操作臂与移动服务机器人、室内与户外)的基础模型训练与评估 易与多任务混淆:跨具身强调物理本体与场景域差距,而非仅任务指令多样性
Action Tokenization 将连续或离散机器人动作映射为模型可预测的 token 序列,便于与语言建模目标统一 不同论文的 tokenization 粒度(离散 bin vs 连续)会影响输出表示与训练目标

早期机器人控制依赖专用策略网络或手工特征,数据与泛化严重受限。RT-1 引入大规模 Transformer 与真实世界数据 scaling,建立 Robotics Transformer 基线。RT-2 与 PaLM-E 进一步将 web 视觉-语言知识 co-fine-tune 进动作模型,实现语义涌现与零样本迁移。随后 OpenVLA 等推动开源 foundation VLA,HumanScale 等工作证明精心策展的 egocentric 人类视频可在预训练阶段优于或替代高成本真机轨迹,形成「大规模异构数据预训练 + 少量真机对齐」的新范式。近期趋势转向跨具身统一、高效微调与真实世界部署评估。

  1. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control(精读)— 奠基性 VLA 工作,明确展示 web 知识向机器人控制的迁移与 foundation 线起点,必读以建立问题框架
  2. OpenVLA: An Open-Source Vision-Language-Action Model(精读)— 提供可复现的开源 foundation VLA 实现与操作任务基线,连接闭源先驱与社区实践
  3. RT-1: Robotics Transformer for Real-World Control at Scale(中文笔记)— RT-2 的直接前驱,阐明大规模真实世界数据与 Transformer 在机器人控制中的 scaling 基础
  1. 先读 RT-1 与 PaLM-E 建立 Robotics Transformer 与 embodied multimodal LM 基础,理解大规模数据与多模态融合动机
  2. 精读 RT-2 掌握 web 知识迁移到 VLA 的 co-fine-tune 范式与动作输出设计
  3. 阅读 OpenVLA 与相关 survey(如 Large VLM-based VLA Models survey、VLA for Robotics review)了解开源实现、架构变体与真实世界应用挑战
  4. 结合 HumanScale 与 MiMo-Embodied 笔记理解数据策略(egocentric 视频)与跨具身统一训练
  5. 最后浏览微调与推理加速相关 watch 论文(如 Fine-Tuning VLA、BLURR、StarVLA)以覆盖工程落地
Paper 输入 输出 表示 训练目标
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control 视觉观察 + 语言指令 机器人动作(tokenized) VLA 联合表示,融合 web VLM 知识 动作预测 + 知识迁移泛化
OpenVLA: An Open-Source Vision-Language-Action Model 视觉 + 语言 动作 开源 VLA backbone 可复现操作任务 foundation 性能
HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining egocentric 人类视频(预训练)+ 真机对齐数据 动作预测 / 任务成功率 世界表征 + 动作对齐 预训练损失降低与 OOD 真机成功提升
PaLM-E: An Embodied Multimodal Language Model 多模态传感器 + 语言 语言 + 具身决策/规划 embodied multimodal LM 多任务具身推理与控制
RT-1: Robotics Transformer for Real-World Control at Scale 视觉 + 指令 动作 Robotics Transformer 大规模真实世界控制 scaling
  • 真机遥操作数据成本高且多样性不足,过度依赖易导致过拟合与 OOD 失败
  • 动作 tokenization 与表示选择影响训练稳定性与实时控制延迟
  • 跨具身与跨域(室内操作 vs 移动服务)时域差距大,正迁移需精心数据策展与多阶段训练
  • 开源模型权重与数据协议不一致,复现与部署面临安全与对齐风险
  • 推理速度与成功率权衡:高效微调/加速方法(如 BLURR 类)可能牺牲泛化
  • 真实世界评估指标与仿真差距,导致 lab 成功难迁移到服务机器人场景
  • 如何系统验证 egocentric 人类视频与真机数据的最优混合比例及后训练协议?
  • 跨具身 foundation 模型(如自动驾驶与室内操作统一)的正迁移边界与负迁移风险如何量化?
  • VLA 在开放词汇、长时程任务与多机器人协作上的 scaling law 是否成立?
  • 高效微调与推理加速能否在不损失 foundation 泛化的前提下满足实时控制需求?
  • 真实世界部署中的安全、可解释性与人机交互对齐如何与 foundation 预训练目标统一?
  1. RT-2 相对于 RT-1 的核心范式转变是什么?它如何利用 web 知识?
  2. OpenVLA 作为开源 VLA 的主要贡献是什么?它与闭源 foundation 模型的定位差异?
  3. HumanScale 的主要发现是什么?为什么 egocentric 人类视频在匹配规模下可能优于真机轨迹?
  4. 比较 VLA 与纯 VLM:动作输出如何表示?训练目标通常如何统一?
  5. 跨具身 foundation 模型(如 MiMo-Embodied 方向)面临的主要挑战有哪些?多阶段训练如何缓解?

本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
foundational RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control 2023 RT-2 foundational VLA; anchors embodied foundation model lin
recent OpenVLA: An Open-Source Vision-Language-Action Model 2024 OpenVLA open foundation VLA for manipulation
watch Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success 2025 auto score=43
watch Vision-Language Model for Object Detection and Segmentation: A Review and Evaluation 2025 auto score=43
watch Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review 2025 cross-topic assign from registry title match=2 keywords; 202
recent Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey 2025 auto refresh 2026-07-19 sources=arxiv
watch MiMo-Embodied: X-Embodied Foundation Model Technical Report 2025 auto refresh 2026-07-19 sources=arxiv
watch BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models 2025 auto refresh 2026-07-19 sources=arxiv
recent StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing 2026 auto refresh 2026-07-19 sources=arxiv
recent HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining 2026 auto refresh 2026-07-19 sources=arxiv
watch A survey on integration of large language models with intelligent robots 2024 auto refresh 2026-07-19 sources=openalex
recent Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications 2025 auto refresh 2026-07-19 sources=openalex
watch Foundation models in robotics: Applications, challenges, and the future 2024 auto refresh 2026-07-19 sources=openalex
foundational RT-1: Robotics Transformer for Real-World Control at Scale 2023 RT-1 is the large-scale robotics transformer predecessor to
foundational PaLM-E: An Embodied Multimodal Language Model 2023 PaLM-E is a foundational embodied multimodal LM
watch RT-2: Vision-Language-Action Models for Generalizable Robotic Control: A Comprehensive Review 2025 auto score=40

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)

Section titled “基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)”

近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)

Section titled “近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)”

观察清单(选题 8 · 可学习 8 · 待获取 PDF 0)

Section titled “观察清单(选题 8 · 可学习 8 · 待获取 PDF 0)”

成熟度 seed · 内容数 69 · 论文池 16