具身基础模型与智能体
具身基础模型与智能体
Section titled “具身基础模型与智能体”LLM、VLM、VLA 与具身智能体等驱动决策与交互的基础模型。
类型 Topics · 更新 2026-07-19
本 Topic 要解决什么
Section titled “本 Topic 要解决什么”本 Topic 聚焦具身基础模型(embodied foundation models)与智能体,解决如何构建能将大规模视觉-语言预训练知识迁移到机器人控制的统一模型问题。核心挑战包括:从纯语言/视觉模型到可输出动作的 VLA 架构设计;用网络数据与人类视频进行可扩展预训练以降低真机采集成本;实现跨任务、跨场景甚至跨具身(如室内操作与移动服务)的泛化;以及开放模型与高效微调以支持真实世界部署。通过 RT 系列、OpenVLA、PaLM-E 等路径,探索从专用策略到 foundation-scale 预训练与后训练的范式,使机器人智能体具备语义理解与物理交互能力。
非目标 / 边界
Section titled “非目标 / 边界”- 不深入纯视觉-语言模型(无动作输出)的预训练细节
- 不覆盖低层电机控制、硬件驱动或仿真引擎实现
- 不展开非具身的通用 LLM 应用或纯导航规划算法
- 不提供具体未给出的实验数值或超参数复现
vlm-understanding— 需先掌握视觉-语言模型的多模态对齐与指令跟随基础,才能理解其向动作扩展的 VLA 设计vla-models— 相邻主题提供 VLA 架构与动作表示入门,本 Topic 在此基础上讨论 foundation 级预训练与跨具身扩展foundations— 需要 Transformer、多模态融合与大规模预训练基本概念作为底座
| 术语 | 含义 | 常见混淆 |
|---|---|---|
| Vision-Language-Action (VLA) Model | 同时处理视觉输入、语言指令并直接输出机器人动作的端到端模型,是具身基础模型的核心形态 | 易与纯 VLM 混淆:VLM 通常只输出文本/描述,VLA 额外产生可执行动作 token 或轨迹 |
| Embodied Foundation Model | 在大规模多模态数据上预训练、可适应多种具身任务(操作、导航、服务)的通用模型,强调知识迁移与跨域泛化 | 与专用机器人策略不同,后者针对单一任务/机器人设计,foundation 强调规模与可迁移性 |
| RT-2 | 将网络视觉-语言知识 co-fine-tune 到机器人控制的 VLA,实现语义泛化与 emergent 能力 | 易与 RT-1 混淆:RT-1 是大规模 Robotics Transformer 前驱,RT-2 进一步融合 web 知识 |
| OpenVLA | 开源的视觉-语言-动作基础模型,面向操作任务,强调可复现与社区可用 | 与闭源商业 VLA 对比时,重点在开放权重与数据协议而非绝对性能数值 |
| Egocentric Human Video Pretraining | 用第一人称人类视频作为具身预训练数据源,匹配规模下可优于或补充真机遥操作轨迹 | 与真机数据对比时注意后训练对齐协议:视频学表征,少量真机做动作对齐 |
| Cross-Embodiment | 统一不同具身形态(如操作臂与移动服务机器人、室内与户外)的基础模型训练与评估 | 易与多任务混淆:跨具身强调物理本体与场景域差距,而非仅任务指令多样性 |
| Action Tokenization | 将连续或离散机器人动作映射为模型可预测的 token 序列,便于与语言建模目标统一 | 不同论文的 tokenization 粒度(离散 bin vs 连续)会影响输出表示与训练目标 |
方法谱系与时间线
Section titled “方法谱系与时间线”早期机器人控制依赖专用策略网络或手工特征,数据与泛化严重受限。RT-1 引入大规模 Transformer 与真实世界数据 scaling,建立 Robotics Transformer 基线。RT-2 与 PaLM-E 进一步将 web 视觉-语言知识 co-fine-tune 进动作模型,实现语义涌现与零样本迁移。随后 OpenVLA 等推动开源 foundation VLA,HumanScale 等工作证明精心策展的 egocentric 人类视频可在预训练阶段优于或替代高成本真机轨迹,形成「大规模异构数据预训练 + 少量真机对齐」的新范式。近期趋势转向跨具身统一、高效微调与真实世界部署评估。
- (2023) foundational — RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- (2023) foundational — RT-1: Robotics Transformer for Real-World Control at Scale
- (2023) foundational — PaLM-E: An Embodied Multimodal Language Model
- (2024) recent — OpenVLA: An Open-Source Vision-Language-Action Model
- (2024) watch — A survey on integration of large language models with intelligent robots
- (2024) watch — Foundation models in robotics: Applications, challenges, and the future
- (2025) watch — Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
- (2025) watch — Vision-Language Model for Object Detection and Segmentation: A Review and Evaluation
- (2025) watch — Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- (2025) recent — Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
- (2025) watch — MiMo-Embodied: X-Embodied Foundation Model Technical Report
- (2025) watch — BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models
- (2025) recent — Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- (2025) watch — RT-2: Vision-Language-Action Models for Generalizable Robotic Control: A Comprehensive Review
- (2026) recent — StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing
- (2026) recent — HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control(精读)— 奠基性 VLA 工作,明确展示 web 知识向机器人控制的迁移与 foundation 线起点,必读以建立问题框架
- OpenVLA: An Open-Source Vision-Language-Action Model(精读)— 提供可复现的开源 foundation VLA 实现与操作任务基线,连接闭源先驱与社区实践
- RT-1: Robotics Transformer for Real-World Control at Scale(中文笔记)— RT-2 的直接前驱,阐明大规模真实世界数据与 Transformer 在机器人控制中的 scaling 基础
推荐阅读路径
Section titled “推荐阅读路径”- 先读 RT-1 与 PaLM-E 建立 Robotics Transformer 与 embodied multimodal LM 基础,理解大规模数据与多模态融合动机
- 精读 RT-2 掌握 web 知识迁移到 VLA 的 co-fine-tune 范式与动作输出设计
- 阅读 OpenVLA 与相关 survey(如 Large VLM-based VLA Models survey、VLA for Robotics review)了解开源实现、架构变体与真实世界应用挑战
- 结合 HumanScale 与 MiMo-Embodied 笔记理解数据策略(egocentric 视频)与跨具身统一训练
- 最后浏览微调与推理加速相关 watch 论文(如 Fine-Tuning VLA、BLURR、StarVLA)以覆盖工程落地
| Paper | 输入 | 输出 | 表示 | 训练目标 |
|---|---|---|---|---|
| RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control | 视觉观察 + 语言指令 | 机器人动作(tokenized) | VLA 联合表示,融合 web VLM 知识 | 动作预测 + 知识迁移泛化 |
| OpenVLA: An Open-Source Vision-Language-Action Model | 视觉 + 语言 | 动作 | 开源 VLA backbone | 可复现操作任务 foundation 性能 |
| HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining | egocentric 人类视频(预训练)+ 真机对齐数据 | 动作预测 / 任务成功率 | 世界表征 + 动作对齐 | 预训练损失降低与 OOD 真机成功提升 |
| PaLM-E: An Embodied Multimodal Language Model | 多模态传感器 + 语言 | 语言 + 具身决策/规划 | embodied multimodal LM | 多任务具身推理与控制 |
| RT-1: Robotics Transformer for Real-World Control at Scale | 视觉 + 指令 | 动作 | Robotics Transformer | 大规模真实世界控制 scaling |
工程实现与复现风险
Section titled “工程实现与复现风险”- 真机遥操作数据成本高且多样性不足,过度依赖易导致过拟合与 OOD 失败
- 动作 tokenization 与表示选择影响训练稳定性与实时控制延迟
- 跨具身与跨域(室内操作 vs 移动服务)时域差距大,正迁移需精心数据策展与多阶段训练
- 开源模型权重与数据协议不一致,复现与部署面临安全与对齐风险
- 推理速度与成功率权衡:高效微调/加速方法(如 BLURR 类)可能牺牲泛化
- 真实世界评估指标与仿真差距,导致 lab 成功难迁移到服务机器人场景
- 如何系统验证 egocentric 人类视频与真机数据的最优混合比例及后训练协议?
- 跨具身 foundation 模型(如自动驾驶与室内操作统一)的正迁移边界与负迁移风险如何量化?
- VLA 在开放词汇、长时程任务与多机器人协作上的 scaling law 是否成立?
- 高效微调与推理加速能否在不损失 foundation 泛化的前提下满足实时控制需求?
- 真实世界部署中的安全、可解释性与人机交互对齐如何与 foundation 预训练目标统一?
Topic 自测清单
Section titled “Topic 自测清单”- RT-2 相对于 RT-1 的核心范式转变是什么?它如何利用 web 知识?
- OpenVLA 作为开源 VLA 的主要贡献是什么?它与闭源 foundation 模型的定位差异?
- HumanScale 的主要发现是什么?为什么 egocentric 人类视频在匹配规模下可能优于真机轨迹?
- 比较 VLA 与纯 VLM:动作输出如何表示?训练目标通常如何统一?
- 跨具身 foundation 模型(如 MiMo-Embodied 方向)面临的主要挑战有哪些?多阶段训练如何缓解?
选篇附录(registry)
Section titled “选篇附录(registry)”本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。
子 Topic
Section titled “子 Topic”论文池(FRW)
Section titled “论文池(FRW)”来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5。
可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。
基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)
Section titled “基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)”- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (2023) · 固定 · 精读
- PaLM-E: An Embodied Multimodal Language Model (2023) · 待获取 PDF
- RT-1: Robotics Transformer for Real-World Control at Scale (2023) · 待获取 PDF
近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)
Section titled “近期重要(选题 5 · 可学习 5 · 待获取 PDF 0)”- OpenVLA: An Open-Source Vision-Language-Action Model (2024) · 固定 · 精读
- Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey (2025) · 中文笔记
- HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining (2026) · 中文笔记
- StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing (2026) · 中文笔记
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications (2025) · 中文笔记
观察清单(选题 8 · 可学习 8 · 待获取 PDF 0)
Section titled “观察清单(选题 8 · 可学习 8 · 待获取 PDF 0)”- A survey on integration of large language models with intelligent robots (2024) · 中文笔记
- MiMo-Embodied: X-Embodied Foundation Model Technical Report (2025) · 中文笔记
- Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review (2025) · 中文笔记
- Foundation models in robotics: Applications, challenges, and the future (2024) · 精读
- BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models (2025) · 中文笔记
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (2025) · 中文笔记
- Vision-Language Model for Object Detection and Segmentation: A Review and Evaluation (2025) · 中文笔记
- RT-2: Vision-Language-Action Models for Generalizable Robotic Control: A Comprehensive Review (2025) · 中文笔记
聚合内容(子树)
Section titled “聚合内容(子树)”成熟度 seed · 内容数 69 · 论文池 16