跳转到内容

具身智能体

具备记忆、规划与交互的长时具身智能体。

类型 Topics · 更新 2026-07-19

本 Topic 聚焦具身智能体(embodied agents)系统,解决如何让智能体从网络空间(cyber space)对齐物理世界,实现感知、交互、规划决策与 sim-to-real 的闭环。核心挑战包括:基于多模态大模型与世界模型构建可行动的机器人/智能体,处理长期记忆中的洞察噪声与高层抽象缺失,支持自我中心观察下对受限人类伙伴的意图与物理约束推断,以及安全、可恢复与升级的治理。目标是形成从仿真平台到真实机器人控制、从单智能体规划到包容性社交协作的系统方法论,服务于 AGI、智能制造与机电系统应用。

  • 不深入纯视觉基础模型预训练细节或非具身 VLA 模型训练配方
  • 不覆盖底层硬件驱动、低层控制律设计或具体机器人机械结构优化
  • 不提供未在 CONTEXT 给出的实验数值指标或攻击/越狱可执行代码
  • foundations — 需掌握多模态感知、基础强化学习/规划与仿真环境概念,才能理解具身闭环与 sim-to-real
  • embodied-foundation-models — 具身智能体常依赖基础模型作为感知与决策 backbone,需先理解其对齐与表示
  • vla-models — 视觉-语言-动作模型是当前具身智能体主流实现路径之一,提供动作生成基础
术语 含义 常见混淆
具身智能体 (Embodied Agent) 具备物理或仿真身体、能通过感知与动作与环境交互并完成任务的智能体,强调 cyber-physical 对齐 易与纯软件 LLM Agent 混淆,后者无物理执行与传感器闭环
多尺度洞察 (Multi-Scale Insight) 从经验中提取不同抽象层次的总结(底层细节到高层先验),用于增强规划与决策的对齐与鲁棒性 易与普通记忆检索混淆,重点在生成、选择与任务相关过滤而非单纯存储
sim-to-real 将仿真环境中训练的策略迁移到真实物理机器人/场景的过程与挑战 不仅是域随机化,还包括感知-动作一致性与安全约束
自我中心观察 (Egocentric Observation) 从智能体自身视角(如 RGB-D)主动感知环境与人类伙伴的状态与意图 与第三人称全局地图不同,强调主动跟随与局部信息不足下的推理
包容性具身社交智能 考虑人类伙伴物理约束(轮椅、力量、身高、速度等)并制定个性化协作计划的能力 不同于标准多智能体协作,核心是个体差异、可及性与风险感知
ARIO 数据集标准 综述中提出的用于统一具身 AI 数据组织与评估的框架建议 非具体现成数据集名称,而是对齐 cyber 与 physical 的数据规范思路

早期具身研究依赖专用仿真平台与手工特征规划,转向基于多模态大模型与世界模型的统一感知-决策架构。从单一任务策略学习演进到多尺度记忆洞察与长期规划,再扩展至考虑人类物理约束的包容性社交协作。安全与治理从事后评估转向主动 recovery 与 upgrade 基准,强调网络空间智能与物理执行的闭环对齐。

  1. Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI(精读)— 首个系统从 MLMs 与 WMs 视角综述具身 AI 的感知/交互/智能体/sim-to-real 四大目标,覆盖机器人、模拟器与 ARIO 标准,是全景框架入口
  2. Habitat: A Platform for Embodied AI Research(精读)— ICCV 2019 经典仿真平台,奠定具身 AI 研究实验基础设施,理解 sim-to-real 与评估的基础
  3. MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making(中文笔记)— 针对长期记忆洞察噪声与高层抽象缺失,提出多尺度生成与选择机制,提升规划鲁棒性,有中文笔记可参考
  1. 先读综述 Aligning Cyber Space… 建立感知-交互-智能体-sim-to-real 分类与 ARIO 框架全局图
  2. 再读 Habitat 平台理解仿真实验与具身评估范式,结合 RT-1 等了解真实控制规模化
  3. 深入 MSI-Agent 学习多尺度洞察与规划增强,随后 CHAIC 理解包容性人类协作与自我中心推理
  4. 扩展至 RynnEC、Hy-Embodied-VLM 等近期 MLLM 融入具身,以及 BadRobot、EmbodiedGovBench 等安全与治理基准
Paper 输入 输出 表示 训练目标
Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI 多模态观测与任务描述 分类框架、机器人/模拟器清单与 ARIO 标准建议 MLMs + 世界模型对齐 cyber-physical 系统综述四大研究目标并统一数据标准
MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making 经验轨迹与任务上下文 多尺度洞察与增强后的规划/决策 经验选择 + 多尺度洞察生成与任务相关选择 减少无关洞察噪声、补充高层先验以提升对齐与领域偏移鲁棒性
Constrained Human-AI Cooperation: An Inclusive Embodied Social Intelligence Challenge 自我中心 RGB-D 观察与受限人类伙伴行为 意图/物理约束推断 + 个性化协作计划 LLM + 行为建模,主动感知 在室内外长视野与风险场景下实现包容性高效协作
Habitat: A Platform for Embodied AI Research 仿真场景配置与智能体动作 导航/交互轨迹与评估指标 高效 3D 仿真与传感器模拟 提供可扩展的具身 AI 研究与基准平台
  • 长期记忆中无关洞察干扰导致规划失败或领域偏移性能下降
  • sim-to-real 间隙导致仿真策略在真实物理约束下失效或安全事故
  • 自我中心视角信息不全时对人类意图与物理限制的误判引发协作风险
  • LLM 基具身智能体存在越狱与物理世界恶意行为风险(如 BadRobot 所示)
  • 治理、恢复与升级机制缺失导致系统长期部署后难以维护与安全迭代
  • 如何设计统一的 ARIO 类标准使不同机器人与模拟器数据可互通并支撑大规模训练
  • 多尺度洞察的自动生成与选择如何与实时物理约束及安全护栏深度耦合
  • 包容性社交智能如何从室内扩展到户外复杂动态环境并处理紧急风险
  • MLLM 融入具身后如何同时保证效率、可解释性与物理世界对齐
  • 治理基准如何覆盖 recovery 与 upgrade 全生命周期而非仅任务成功率
  1. 具身智能体与纯软件 LLM Agent 的核心区别是什么?请从感知-动作闭环角度说明。
  2. MSI-Agent 中多尺度洞察试图解决长期记忆的哪两类主要问题?
  3. CHAIC 挑战强调的包容性具体体现在哪些人类物理约束上?智能体需完成什么核心推理?
  4. 综述中提出的四大研究目标是什么?ARIO 标准试图解决什么?
  5. 为什么 sim-to-real 与安全治理(如 EmbodiedGovBench)对实际部署具身智能体至关重要?

本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
foundational Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI 2024 auto refresh 2026-07-19 sources=arxiv,openalex
watch BadRobot: Jailbreaking Embodied LLM Agents in the Physical World 2024 cross-topic assign from registry title match=3 keywords; 202
watch MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making 2024 cross-topic assign from registry title match=2 keywords; 202
recent Constrained Human-AI Cooperation: An Inclusive Embodied Social Intelligence Challenge 2024 auto refresh 2026-07-19 sources=arxiv
watch Integrating Vision Foundation Models with Reinforcement Learning for Enhanced Object Interaction 2025 auto score=39
foundational RynnEC: Bringing MLLMs into Embodied World 2025 auto refresh 2026-07-19 sources=arxiv
recent EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems 2026 auto refresh 2026-07-19 sources=arxiv
recent PInVerify: An Offline Embodied Benchmark for Active Instance Verification 2026 auto refresh 2026-07-19 sources=arxiv
recent Hy-Embodied-VLM-1.0: Efficient Physical-World Agents 2026 auto refresh 2026-07-19 sources=arxiv
watch Artificial Intelligence (AI) Algorithm and Models for Embodied Agents (Robots and Drones) 2024 auto score=38
watch A survey on large language model based autonomous agents 2024 auto refresh 2026-07-19 sources=openalex
watch Open-source vision-language-action models for robotics 2025 auto score=40
foundational Habitat: A Platform for Embodied AI Research 2019 ICCV 2019 Habitat — standard embodied AI simulation platform
recent Foundations & Trends in Multimodal Machine Learning: Principles, Challenges, and Open Questions 2024 auto refresh 2026-07-19 sources=openalex
watch RT-1: Robotics Transformer for Real-World Control at Scale 2023 auto refresh 2026-07-19 sources=openalex
watch A Review of Machine Learning and Deep Learning for Object Detection, Semantic Segmentation, and Human Action Recognition in Machine and Robotic Vision 2024 auto refresh 2026-07-19 sources=openalex

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)

Section titled “基础必读(选题 3 · 可学习 3 · 待获取 PDF 0)”

近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)

Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”

观察清单(选题 8 · 可学习 6 · 待获取 PDF 2)

Section titled “观察清单(选题 8 · 可学习 6 · 待获取 PDF 2)”

成熟度 seed · 内容数 16 · 论文池 16