具身智能体
具备记忆、规划与交互的长时具身智能体。
类型 Topics · 更新 2026-07-19
本 Topic 要解决什么
Section titled “本 Topic 要解决什么”本 Topic 聚焦具身智能体(embodied agents)系统,解决如何让智能体从网络空间(cyber space)对齐物理世界,实现感知、交互、规划决策与 sim-to-real 的闭环。核心挑战包括:基于多模态大模型与世界模型构建可行动的机器人/智能体,处理长期记忆中的洞察噪声与高层抽象缺失,支持自我中心观察下对受限人类伙伴的意图与物理约束推断,以及安全、可恢复与升级的治理。目标是形成从仿真平台到真实机器人控制、从单智能体规划到包容性社交协作的系统方法论,服务于 AGI、智能制造与机电系统应用。
非目标 / 边界
Section titled “非目标 / 边界”- 不深入纯视觉基础模型预训练细节或非具身 VLA 模型训练配方
- 不覆盖底层硬件驱动、低层控制律设计或具体机器人机械结构优化
- 不提供未在 CONTEXT 给出的实验数值指标或攻击/越狱可执行代码
foundations— 需掌握多模态感知、基础强化学习/规划与仿真环境概念,才能理解具身闭环与 sim-to-realembodied-foundation-models— 具身智能体常依赖基础模型作为感知与决策 backbone,需先理解其对齐与表示vla-models— 视觉-语言-动作模型是当前具身智能体主流实现路径之一,提供动作生成基础
| 术语 | 含义 | 常见混淆 |
|---|---|---|
| 具身智能体 (Embodied Agent) | 具备物理或仿真身体、能通过感知与动作与环境交互并完成任务的智能体,强调 cyber-physical 对齐 | 易与纯软件 LLM Agent 混淆,后者无物理执行与传感器闭环 |
| 多尺度洞察 (Multi-Scale Insight) | 从经验中提取不同抽象层次的总结(底层细节到高层先验),用于增强规划与决策的对齐与鲁棒性 | 易与普通记忆检索混淆,重点在生成、选择与任务相关过滤而非单纯存储 |
| sim-to-real | 将仿真环境中训练的策略迁移到真实物理机器人/场景的过程与挑战 | 不仅是域随机化,还包括感知-动作一致性与安全约束 |
| 自我中心观察 (Egocentric Observation) | 从智能体自身视角(如 RGB-D)主动感知环境与人类伙伴的状态与意图 | 与第三人称全局地图不同,强调主动跟随与局部信息不足下的推理 |
| 包容性具身社交智能 | 考虑人类伙伴物理约束(轮椅、力量、身高、速度等)并制定个性化协作计划的能力 | 不同于标准多智能体协作,核心是个体差异、可及性与风险感知 |
| ARIO 数据集标准 | 综述中提出的用于统一具身 AI 数据组织与评估的框架建议 | 非具体现成数据集名称,而是对齐 cyber 与 physical 的数据规范思路 |
方法谱系与时间线
Section titled “方法谱系与时间线”早期具身研究依赖专用仿真平台与手工特征规划,转向基于多模态大模型与世界模型的统一感知-决策架构。从单一任务策略学习演进到多尺度记忆洞察与长期规划,再扩展至考虑人类物理约束的包容性社交协作。安全与治理从事后评估转向主动 recovery 与 upgrade 基准,强调网络空间智能与物理执行的闭环对齐。
- (2019) foundational — Habitat: A Platform for Embodied AI Research
- (2023) watch — RT-1: Robotics Transformer for Real-World Control at Scale
- (2024) foundational — Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI
- (2024) watch — BadRobot: Jailbreaking Embodied LLM Agents in the Physical World
- (2024) watch — MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making
- (2024) recent — Constrained Human-AI Cooperation: An Inclusive Embodied Social Intelligence Challenge
- (2024) watch — Artificial Intelligence (AI) Algorithm and Models for Embodied Agents (Robots and Drones)
- (2024) watch — A survey on large language model based autonomous agents
- (2024) recent — Foundations & Trends in Multimodal Machine Learning: Principles, Challenges, and Open Questions
- (2024) watch — A Review of Machine Learning and Deep Learning for Object Detection, Semantic Segmentation, and Human Action Recognition in Machine and Robotic Vision
- (2025) foundational — RynnEC: Bringing MLLMs into Embodied World
- (2025) watch — Integrating Vision Foundation Models with Reinforcement Learning for Enhanced Object Interaction
- (2025) watch — Open-source vision-language-action models for robotics
- (2026) recent — EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems
- (2026) recent — PInVerify: An Offline Embodied Benchmark for Active Instance Verification
- (2026) recent — Hy-Embodied-VLM-1.0: Efficient Physical-World Agents
- Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI(精读)— 首个系统从 MLMs 与 WMs 视角综述具身 AI 的感知/交互/智能体/sim-to-real 四大目标,覆盖机器人、模拟器与 ARIO 标准,是全景框架入口
- Habitat: A Platform for Embodied AI Research(精读)— ICCV 2019 经典仿真平台,奠定具身 AI 研究实验基础设施,理解 sim-to-real 与评估的基础
- MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making(中文笔记)— 针对长期记忆洞察噪声与高层抽象缺失,提出多尺度生成与选择机制,提升规划鲁棒性,有中文笔记可参考
推荐阅读路径
Section titled “推荐阅读路径”- 先读综述 Aligning Cyber Space… 建立感知-交互-智能体-sim-to-real 分类与 ARIO 框架全局图
- 再读 Habitat 平台理解仿真实验与具身评估范式,结合 RT-1 等了解真实控制规模化
- 深入 MSI-Agent 学习多尺度洞察与规划增强,随后 CHAIC 理解包容性人类协作与自我中心推理
- 扩展至 RynnEC、Hy-Embodied-VLM 等近期 MLLM 融入具身,以及 BadRobot、EmbodiedGovBench 等安全与治理基准
| Paper | 输入 | 输出 | 表示 | 训练目标 |
|---|---|---|---|---|
| Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI | 多模态观测与任务描述 | 分类框架、机器人/模拟器清单与 ARIO 标准建议 | MLMs + 世界模型对齐 cyber-physical | 系统综述四大研究目标并统一数据标准 |
| MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making | 经验轨迹与任务上下文 | 多尺度洞察与增强后的规划/决策 | 经验选择 + 多尺度洞察生成与任务相关选择 | 减少无关洞察噪声、补充高层先验以提升对齐与领域偏移鲁棒性 |
| Constrained Human-AI Cooperation: An Inclusive Embodied Social Intelligence Challenge | 自我中心 RGB-D 观察与受限人类伙伴行为 | 意图/物理约束推断 + 个性化协作计划 | LLM + 行为建模,主动感知 | 在室内外长视野与风险场景下实现包容性高效协作 |
| Habitat: A Platform for Embodied AI Research | 仿真场景配置与智能体动作 | 导航/交互轨迹与评估指标 | 高效 3D 仿真与传感器模拟 | 提供可扩展的具身 AI 研究与基准平台 |
工程实现与复现风险
Section titled “工程实现与复现风险”- 长期记忆中无关洞察干扰导致规划失败或领域偏移性能下降
- sim-to-real 间隙导致仿真策略在真实物理约束下失效或安全事故
- 自我中心视角信息不全时对人类意图与物理限制的误判引发协作风险
- LLM 基具身智能体存在越狱与物理世界恶意行为风险(如 BadRobot 所示)
- 治理、恢复与升级机制缺失导致系统长期部署后难以维护与安全迭代
- 如何设计统一的 ARIO 类标准使不同机器人与模拟器数据可互通并支撑大规模训练
- 多尺度洞察的自动生成与选择如何与实时物理约束及安全护栏深度耦合
- 包容性社交智能如何从室内扩展到户外复杂动态环境并处理紧急风险
- MLLM 融入具身后如何同时保证效率、可解释性与物理世界对齐
- 治理基准如何覆盖 recovery 与 upgrade 全生命周期而非仅任务成功率
Topic 自测清单
Section titled “Topic 自测清单”- 具身智能体与纯软件 LLM Agent 的核心区别是什么?请从感知-动作闭环角度说明。
- MSI-Agent 中多尺度洞察试图解决长期记忆的哪两类主要问题?
- CHAIC 挑战强调的包容性具体体现在哪些人类物理约束上?智能体需完成什么核心推理?
- 综述中提出的四大研究目标是什么?ARIO 标准试图解决什么?
- 为什么 sim-to-real 与安全治理(如 EmbodiedGovBench)对实际部署具身智能体至关重要?
选篇附录(registry)
Section titled “选篇附录(registry)”本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。
论文池(FRW)
Section titled “论文池(FRW)”来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5。
可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。
基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)
Section titled “基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)”- Habitat: A Platform for Embodied AI Research (2019) · 固定 · 中文笔记
- Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI (2024) · 中文笔记
- RynnEC: Bringing MLLMs into Embodied World (2025) · 中文笔记
近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)
Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”- Hy-Embodied-VLM-1.0: Efficient Physical-World Agents (2026) · 中文笔记
- Constrained Human-AI Cooperation: An Inclusive Embodied Social Intelligence Challenge (2024) · 中文笔记
- EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems (2026) · 中文笔记
- PInVerify: An Offline Embodied Benchmark for Active Instance Verification (2026) · 中文笔记
- Foundations & Trends in Multimodal Machine Learning: Principles, Challenges, and Open Questions (2024) · 待获取 PDF
观察清单(选题 8 · 可学习 6 · 待获取 PDF 2)
Section titled “观察清单(选题 8 · 可学习 6 · 待获取 PDF 2)”- BadRobot: Jailbreaking Embodied LLM Agents in the Physical World (2024) · 中文笔记
- A survey on large language model based autonomous agents (2024) · 中文笔记
- MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making (2024) · 中文笔记
- Open-source vision-language-action models for robotics (2025) · 中文笔记
- Integrating Vision Foundation Models with Reinforcement Learning for Enhanced Object Interaction (2025) · 中文笔记
- Artificial Intelligence (AI) Algorithm and Models for Embodied Agents (Robots and Drones) (2024) · 中文笔记
- A Review of Machine Learning and Deep Learning for Object Detection, Semantic Segmentation, and Human Action Recognition in Machine and Robotic Vision (2024) · 待获取 PDF
- RT-1: Robotics Transformer for Real-World Control at Scale (2023) · 待获取 PDF
成熟度 seed · 内容数 16 · 论文池 16