跳转到内容

UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy

UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy

Section titled “UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy”

⚠️ AI 生成 · 建议对照原文 本页为自动整理的学习笔记;关键数据与引用如需引用,请回查 PDF / 官方版本。

学习档位 中文笔记

类型 文献 · 更新 2026-07-19

所属 机器人操作

中文学习笔记(自动生成,需核验)

Section titled “中文学习笔记(自动生成,需核验)”

Topic: robot-manipulation · Tier: recent · Year: 2023 · Venue:
Evidence level: partial · 本地全文: 是 · 建议阅读: ~75 分钟
Paper: https://arxiv.org/abs/2303.00938
Code:
Generator: grok

首次在真实感输入(点云+本体感觉)下实现跨数百类别(含未见)的通用灵巧手抓取,将抓取提案生成与目标条件执行解耦,并引入旋转分解概率模型、状态规范化和课程学习等关键创新,为高自由度灵巧操作提供可扩展的两阶段范式。

通过分解旋转的概率抓取提案生成(GraspIPDF+GraspGlow+ContactNet)与目标条件策略(教师-学生蒸馏+规范化+对象课程),在Isaac Gym中对数千物体实例实现>60%成功率的通用灵巧抓取。

在桌面设置下,仅从点云观测学习通用机器人灵巧抓取:以高质量、多样化方式抓取并抬起物体,跨数百类别甚至未见物体泛化;输入仅为深度点云与机器人本体感觉,输出为ShadowHand类高维(约26 DoF)手部动作轨迹。

点云深度学习(PointNet/PointNet++)、SO(3)概率建模(IPDF)、归一化流(Glow)、强化学习(PPO)、模仿学习(DAgger)、教师-学生蒸馏、Isaac Gym物理仿真基础;了解并行夹爪抓取流水线与灵巧手高维挑战。

  • 提出条件抓取姿态概率模型,将旋转与平移/关节角分解:GraspIPDF(基于IPDF建模p(R|X0))+ GraspGlow(基于Glow建模规范点云下的p(t̃,q|X̃0)),并结合ContactNet测试时优化,实现高多样性高质量提案。
  • 提出仅用现实输入的目标条件抓取策略,通过状态规范化(SO(2)等变性)、对象课程学习与教师-学生蒸馏(oracle教师+DAgger学生)解决高维视觉策略学习难题。
  • 构建大规模桌面灵巧抓取数据集(>100万抓取、5519实例、133类别),并首次展示通用灵巧抓取流水线(提案+执行)在数千实例上>60%成功率、显著优于基线且泛化间隙小。
  • 将两阶段集成,使流水线可按语言等条件选择提案,并在仿真中验证端到端通用性。

两阶段:1)抓取提案生成:输入初始点云X0(物体+桌面,有分割),GraspIPDF采样根旋转R;用R^{-1}规范化点云得X̃0;GraspGlow采样平移t̃与关节角q;ContactNet预测接触图并优化物理合理性;最终g=(R,t,q)变换回原坐标系。2)目标条件执行:以g为目标,策略每步输入Xt(点云)、本体感觉srt与g,输出动作at;先在Isaac Gym用PPO+课程+规范化训练oracle教师(可访问真值状态),再DAgger蒸馏为学生(仅现实输入);手初始化为固定高度、掌心朝下、关节归零;成功条件为物体抬升至目标高度且位置差小于阈值。

GraspIPDF:PointNet++提取特征,输出未归一化log概率,用SO(3)等体积网格归一化并用NLL训练;测试时按概率采样。GraspGlow:规范化点云后用PointNet+Glow建模欧氏空间分布,NLL训练。ContactNet:映射瑕疵姿态到理想接触图,支持测试时优化以减少穿透/不精确接触。策略:状态规范化保证SO(2)等变;对象课程(单物体→单类→多类→全类);教师访问真值位姿/速度/完整点云,学生仅点云+本体;DAgger蒸馏。取舍:分解旋转避免直接在SO(3)×R^n上建流的拓扑问题;用生成模型+优化替代CVAE以提升多样性;用目标条件策略替代运动规划以处理高维执行复杂性。

自合成大规模桌面灵巧抓取数据集:>100万抓取姿态,5519物体实例,133类别(最大灵巧抓取基准)。仿真:Isaac Gym。指标:提案阶段多样性与抓取质量;端到端成功率(抬起物体位置差<阈值)、泛化间隙(见/未见类别)、与基线对比。输入:融合深度点云(含桌面/物体分割)。

提案生成是唯一同时展现高多样性与最高抓取质量的方法。完整流水线平均成功率超过60%(数千物体实例),显著优于所有基线,泛化间隙极小;首次实现灵巧抓取的通用泛化。

提取中未详细报告具体失败场景或定量边界;强调高维执行复杂、直接视觉RL困难,依赖仿真真值教师与合成数据,现实迁移与非桌面场景待进一步验证(待来源核验)。

与前序 / 同期 / 后续方法的关系

Section titled “与前序 / 同期 / 后续方法的关系”

灵巧抓取合成:非学习方法(GraspIt!、可微力闭合优化)生成数据集;学习方法(含CVAE的GraspTTA)难同时兼顾质量与多样性,本文用分解IPDF+Glow解决。SO(3)×R^n概率建模:现有NF在SO(3)有拓扑问题,IPDF更适合。执行:解析方法需简化几何;先前RL/IL多依赖完整网格或不泛化到大量物体/原始视觉,本文通过教师-学生、课程与规范化实现数千实例通用。受并行夹爪两阶段流水线启发,但针对高维灵巧做专门设计。

官方将公开数据集与代码,项目页https://pku-epic.github.io/UniDexGrasp/。复现建议:先复现提案阶段(IPDF+Glow+ContactNet)在合成数据上的NLL与采样多样性;再按对象课程训练教师PPO,DAgger蒸馏学生;注意点云规范化、SO(3)网格采样与Isaac Gym设置;提取中承诺公开以促进后续研究。

先读Abstract与Introduction(问题、两阶段动机与主要结果)→ Method 3.1概述与Fig.2 → 3.2提案生成(IPDF/Glow/ContactNet细节)→ 3.3策略(规范化/课程/蒸馏)→ Related Work对比 → Experiments结果(若有)→ 结论与附录(SO(3)分析等)。重点看概率分解与策略创新部分。

  1. Q: 为什么将抓取姿态生成分解为GraspIPDF与GraspGlow两部分? A: 手姿态空间是SO(3)×R^{3+K},直接在其上建归一化流存在拓扑不连续或无穷映射问题;分解后用IPDF处理旋转、Glow处理规范化后的平移与关节角,并简化条件建模。
  2. Q: 状态规范化在策略中起什么作用? A: 确保SO(2)等变性,降低策略学习难度,使模型对绕垂直轴旋转不变,便于跨物体/目标泛化。
  3. Q: 教师-学生框架如何解决现实输入下的策略学习? A: 先用PPO+课程+规范化训练可访问oracle状态(真值位姿/速度/完整点云)的教师,再用DAgger蒸馏到仅用点云与本体感觉的学生策略。
  4. Q: ContactNet在提案阶段的作用是什么? A: 预测理想接触图,用于测试时优化以减少流采样带来的轻微穿透与不精确接触,提升物理合理性。
  5. Q: 对象课程学习的大致顺序是什么? A: 先学单物体多目标 → 单类别 → 多类别 → 全部类别,逐步提升教师策略的泛化能力。
  • page 1 Abstract: demonstrating an average success rate of more than 60% on thousands of object instances, which significantly outperforms all baselines, meanwhile showing only a minimal generalization gap.
  • page 1 Abstract / Intro: Our dataset contains more than one million grasps for 5519 object instances from 133 object categories, which is the largest robotic dexterous grasping benchmark
  • page 2: we propose to decompose this conditional generative model into two conditional generative models: a conditional rotation generative model, namely GraspIPDF, leveraging ImplicitPDF [36] … and a conditional normalizing flow, namely GraspGlow, leveraging Glow [25].
  • page 2: we introduce two critical innovations: a canonicalization step that ensures SO(2) equivariance to ease the policy learning; and an object curriculum that first learns to grasp one object with different goals, then one category, then many categories, and finally all categories.
  • page 3: The whole dexterous grasping pipeline, from the vision to policy, again achieves impressive performance in our simulation environment and, for the first time, demonstrates a universal grasping policy with more than 60% success rate and remarkably outperforms all the baselines.

生成:2026-07-21 · 来源条数 2 · 模型 heuristic · 需人工核验数字

围绕「UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy」的核心问题与动机(待结合全文核验)。

  • 见原文方法章节;以下为基于摘要/摘录的要点提示。
  • UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and…

与相近工作的关系待核验;请对照 related work。

  • 勿仅凭摘要推断未给出的数值指标。
  1. 这篇工作的输入/输出表示是什么?(UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy)
  2. 训练目标与评测协议各是什么?
  3. 主要失败模式或局限是什么?
flowchart LR
A["输入 / 观测"] --> B["表示 / 编码"]
B --> C["推理 / 解码"]
C --> D["输出 / 动作或检测"]
%% method sketch for: UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal

方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。

UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy arch p.1

来源:原论文约 p.1(arch);学习用途摘录。

UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy table p.16

来源:原论文约 p.16(table);学习用途摘录。

展开英文 Paper Card / AI deep analysis
Field Content
Year 2023
Authors Yinzhen Xu, Weikang Wan, Jialiang Zhang, Haoran Liu, Zikang Shan, Hao Shen, Ruicheng Wang, Haoran Geng, Yijia Weng, Jiayi Chen, Tengyu Liu, Yi Li
arXiv 2303.00938
DOI 10.1109/cvpr52729.2023.00459
Topics robot-manipulation
Paper https://arxiv.org/abs/2303.00938
展开 Extract / Selections / Local assets
  • robot-manipulation: tier=recent rank=5 score=53 — CVPR 2023 UniDexGrasp — universal dexterous grasping
(no PDF text available; metadata-only card)