RynnEC: Bringing MLLMs into Embodied World
RynnEC: Bringing MLLMs into Embodied World
Section titled “RynnEC: Bringing MLLMs into Embodied World”⚠️ AI 生成 · 建议对照原文 本页为自动整理的学习笔记;关键数据与引用如需引用,请回查 PDF / 官方版本。
学习档位 中文笔记
类型 文献 · 更新 2026-07-19
所属 具身智能体
中文学习笔记(自动生成,需核验)
Section titled “中文学习笔记(自动生成,需核验)”Topic: embodied-agents · Tier: foundational · Year: 2025 · Venue: —
Evidence level: partial · 本地全文: 是 · 建议阅读: ~40 分钟
Paper: https://arxiv.org/abs/2508.14160
Code: —
Generator: grok
为什么值得读
Section titled “为什么值得读”RynnEC将通用视频MLLM扩展为具身认知核心,通过区域掩码级灵活交互解决物体细节与连贯空间理解不足问题,并提供可扩展的自我中心视频数据生成管道与专用基准,有助于具身智能的通用认知与长时程任务执行。
RynnEC是面向具身认知的视频多模态大语言模型,集成区域编码器与掩码解码器,实现视频区域级交互,并在物体属性理解、分割与空间推理上达到先进水平。
现有主流MLLM缺乏灵活视觉交互(易产生歧义)、物体细节理解不足(物体是任务最小操作单元)以及基于连续视频的连贯空间意识(当前方法多聚焦单帧/离散图像),难以直接用于物理机器人执行复杂具身任务。
多模态大语言模型与视频理解基础(如VideoLLaMA3)、实例分割与跟踪(Grounding DINO、SAM2)、自我中心视频与空间认知概念、简单3D重建/SLAM知识。
- 提出RynnEC视频MLLM,基于通用视觉-语言基础模型加入区域编码器与掩码解码器,支持视频+区域掩码+文本交织输入,输出文本或掩码,实现区域中心的具身认知范式。
- 提出基于自我中心RGB视频的具身认知数据生成管道,通过实例分割后分物体认知与空间认知两分支生成QA数据,缓解3D标注稀缺问题。
- 引入RynnEC-Bench区域中心基准,涵盖物体与空间认知共22个任务,用于评估具身认知能力。
- 在物体属性理解、物体分割与空间推理上达到SOTA,展示多任务训练优势与挑战性任务涌现迹象,并凸显对长时程机器人任务的潜力。
- 自我中心视频收集与实例分割:从200+家庭采集视频,用Qwen2.5-VL生成物体列表,Grounding DINO检测关键帧,SAM2分割跟踪并保持ID一致性,得到视频实例掩码。2. 物体QA分支:提取实例关键帧与提示图像,生成字幕、理解QA(含计数)与指代表达(简单与情境式),人工过滤。3. 空间QA分支:利用单目密集3D重建(MASt3r-SLAM等)与模板生成世界中心与自我中心空间QA。4. 整合数据训练RynnEC模型(视觉编码器源自VideoLLaMA3 + 区域编码器 + 掩码解码器 + LLM)。
关键模块和设计取舍
Section titled “关键模块和设计取舍”视觉编码器与基础参数来自VideoLLaMA3;新增区域编码器处理视频区域掩码输入;掩码解码器支持输出掩码;整体支持交织视频/掩码/文本输入与文本/掩码输出。设计取舍:采用掩码中心管道提升数据可重用性与连续性(避免按任务独立生成),实例过滤与下采样缓解长尾分布与重复;空间分支依赖3D重建获取尺度与位置信息以支持世界/自我中心认知。
数据集、实验设置与指标
Section titled “数据集、实验设置与指标”从超过200个家庭采集超过20,000个自我中心视频(具体20,832个,分辨率≥1080p、帧率≥30fps,每40秒分段),生成约114万视频实例掩码。RynnEC-Bench从10个家庭子集手动验证与平衡,包含物体与空间认知共22个任务。具体评估指标与实验设置细节待来源核验。
主要结果(需原文证据)
Section titled “主要结果(需原文证据)”RynnEC在具身场景认知能力上显著优于通用与任务特定MLLM;多任务训练有显著优势,挑战性具身认知任务出现初步涌现迹象;对机器人大规模长时程任务有潜力。具体数值与对比细节待来源核验。
局限、失败场景与适用边界
Section titled “局限、失败场景与适用边界”依赖高质量自我中心视频与分割/重建质量(SAM2在自我中心场景一致性有限);空间数据生成需3D重建校准;完整失败场景、适用边界与扩展性局限待来源核验。
与前序 / 同期 / 后续方法的关系
Section titled “与前序 / 同期 / 后续方法的关系”视频理解MLLM方面相关于早期稀疏采样/连接器方法、长视频压缩以及区域级视频MLLM(如VideoRefer、DAM、PAM),但后者缺乏自我中心具身物理世界理解。具身基准相关于OpenEQA、VSI-Bench、ECBench等,但RynnEC-Bench更强调区域级细粒度交互。改进具身认知MLLM方面对比Exo2Ego/EgoLM、SpatialVLM/SpatialRGPT、GPT4Scene、SAT以及基于3D数据集的Spatial-MLLM/Multi-SpatialMLLM/SpaceR,RynnEC强调基于RGB视频的可扩展现实数据与统一区域范式覆盖更广世界认知。
官方代码与复现建议
Section titled “官方代码与复现建议”官方代码、模型检查点与基准可从https://github.com/alibaba-damo-academy/RynnEC获取。复现建议:按论文数据生成管道从自我中心视频出发,使用提供的模型检查点在RynnEC-Bench评估;完整训练细节与配置待来源核验。
推荐阅读顺序
Section titled “推荐阅读顺序”先读摘要与图1(整体能力与示例任务);再Introduction(问题与动机);Related Work(定位);Methodology(数据生成管道→评估框架→架构→训练);最后实验结果与讨论(摘录有限,补充全文)。
- Q: RynnEC的核心架构创新是什么?它如何支持灵活交互? A: 在通用视频VLM(VideoLLaMA3)基础上加入区域编码器和掩码解码器,支持视频、区域掩码与文本交织输入,并可输出文本或掩码,实现实例级精确理解与定位。
- Q: 具身认知能力被划分为哪两大类?空间认知进一步如何细分? A: 物体认知(属性、数量、与环境关系及精确定位)和空间认知;空间认知分为世界中心(绝对尺度与相对位置)和自我中心(连接机器人身体与世界的可达性、方向等)。
- Q: 数据生成管道的起点与两分支分别是什么? A: 起点为自我中心视频实例分割(Qwen2.5-VL+Grounding DINO+SAM2);一分支生成物体QA(字幕、理解、指代表达);另一分支通过3D重建生成空间QA。
- Q: RynnEC-Bench的规模与任务覆盖如何? A: 从10个家庭手动验证平衡的子集构建,涵盖物体与空间认知共22个任务,强调区域中心细粒度评估。
- Q: 现有方法在具身应用中的三大主要局限是什么? A: 缺乏灵活视觉交互(文本易歧义);物体细节理解不足;缺少基于高连续性视频的连贯空间意识。
- page 1 / Abstract: We introduce RynnEC, a video multimodal large language model designed for embodied cognition. Built upon a general-purpose vision-language foundation model, RynnEC incorporates a region encoder and a mask decoder, enabling flexible region-level video interaction.
- page 1 / Abstract: To mitigate the scarcity of annotated 3D datasets, we propose an egocentric video based pipeline for generating embodied cognition data. Furthermore, we introduce RynnEC-Bench, a region-centered benchmark for evaluating embodied cognitive capabilities.
- page 2 / Introduction: 1. Lack of flexible visual interaction… 2. Insufficient detailed understanding of objects… 3. Absence of video-based coherent spatial awareness…
- page 2-3: From over 200 households, we collect more than 20,000 egocentric videos. A subset from ten households is manually verified and balanced to create RynnEC-Bench… encompassing 22 tasks in object and spatial cognition.
- page 4 / Sec 3.1.1: Ultimately, we collect 20,832 egocentric videos of indoor movement… In total, we obtain 1.14 million video instance masks from all the egocentric videos.
- page 1 / Abstract: The code, model checkpoints, and benchmark are available at: https://github.com/alibaba-damo-academy/RynnEC
Discovery evidence
Section titled “Discovery evidence”- topic:
embodied-capabilities - sources:
arxiv - retrieved_at: 2026-07-20
- query: embodied capabilities manipulation navigation
- arxiv:
2508.14160 - score_total: 45
- suggested_tier:
watch
Relevance
Section titled “Relevance”(no prose relevance explanation — numeric score only or HTTP source)
Snippets
Section titled “Snippets”(no snippet evidence in candidate pool)
延伸解读与背景补充
Section titled “延伸解读与背景补充”生成:2026-07-21 · 来源条数 2 · 模型
heuristic· 需人工核验数字
围绕「RynnEC: Bringing MLLMs into Embodied World」的核心问题与动机(待结合全文核验)。
方法要点补强
Section titled “方法要点补强”- 见原文方法章节;以下为基于摘要/摘录的要点提示。
- RynnEC: Bringing MLLMs into Embodied World Ronghao Dang∗1,2 , Yuqian Yuan∗1,3 , Yunxuan Mao∗1,3 , Kehan Li∗1,2…
与相近工作的关系
Section titled “与相近工作的关系”与相近工作的关系待核验;请对照 related work。
- 勿仅凭摘要推断未给出的数值指标。
- 这篇工作的输入/输出表示是什么?(RynnEC: Bringing MLLMs into Embodied World)
- 训练目标与评测协议各是什么?
- 主要失败模式或局限是什么?
外部解读索引
Section titled “外部解读索引”- [2508.14160] RynnEC: Bringing MLLMs into Embodied World — 2026-07-21 — 官方摘要/二次页面(自动抓取)
- [2508.14160] RynnEC: Bringing MLLMs into Embodied World — 2026-07-21 — 官方摘要/二次页面(自动抓取)
方法结构(重绘)
Section titled “方法结构(重绘)”flowchart LR A["输入 / 观测"] --> B["表示 / 编码"] B --> C["推理 / 解码"] C --> D["输出 / 动作或检测"] %% method sketch for: RynnEC: Bringing MLLMs into Embodied World方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。
论文摘录图/表
Section titled “论文摘录图/表”
来源:原论文约 p.1(arch);学习用途摘录。

来源:原论文约 p.9(table);学习用途摘录。
英文自动分析(可折叠)
Section titled “英文自动分析(可折叠)”展开英文 Paper Card / AI deep analysis
Paper Card
Section titled “Paper Card”| Field | Content |
|---|---|
| Year | 2025 |
| Authors | Ronghao Dang, Yuqian Yuan, Yunxuan Mao, Kehan Li, Jiangpin Liu, Zhikai Wang, Xin Li, Fan Wang, Deli Zhao |
| arXiv | 2508.14160 |
| DOI | — |
| Topics | embodied-agents |
| Paper | https://arxiv.org/abs/2508.14160 |
原文摘录与素材(可折叠)
Section titled “原文摘录与素材(可折叠)”展开 Extract / Selections / Local assets
Selections
Section titled “Selections”embodied-agents: tier=foundational rank=4 score=58 — auto refresh 2026-07-19 sources=arxiv | promoted recent->foundational for coverage fill
Extract excerpt
Section titled “Extract excerpt”RynnEC: Bringing MLLMs into Embodied World Ronghao Dang∗1,2 , Yuqian Yuan∗1,3 , Yunxuan Mao∗1,3 , Kehan Li∗1,2 , Jiangpin Liu1,3 , Zhikai Wang1,2 , Fan Wang1 , Deli Zhao1,2 , Xin Li1,2 1 DAMO Academy, Alibaba Group 2 Hupan Lab 3 Zhejiang University ∗ Equal contribution
We introduce RynnEC, a video multimodal large language model designed for embodied cognition. Built upon a general-purpose vision-language foundation model, RynnEC incorporates a region encoder and a mask decoder, enabling flexible region-level video interaction. Despite its compact
arXiv:2508.14160v2 [cs.CV] 18 Nov 2025 architecture, RynnEC achieves state-of-the-art performance in object property understanding, object segmentation, and spatial reasoning. Conceptually, it offers a region-centric video paradigm for the brain of embodied agents, providing fine-grained perception of the physical world and enabling more precise interactions. To mitigate the scarcity of annotated 3D datasets, we propose an egocentric video based pipeline for generating embodied cognition data. Furthermore, we introduce RynnEC-Bench, a region-centered benchmark for evaluating embodied cognitive capabilities. We anticipate that RynnEC will advance the development of general-purpose cognitive cores for embodied agents and facilitate generalization across diverse embodied tasks. The code, model checkpoints, and benchmark are available at: https://github.com/alibaba-damo-academy/RynnEC
Date: November 19, 2025