跳转到内容

机器人操作

机械臂抓取、操作与接触丰富控制的策略与表征。

类型 Topics · 更新 2026-07-20

本Topic聚焦机器人操作核心挑战:在非结构化环境中实现可靠抓取与灵巧操作,覆盖从物体点云/视觉输入预测多样高质量抓取姿态、高自由度手部动作生成,到结合视觉-语言-动作(VLA)模型实现语言条件下的通用操作。关键问题包括传统刚性规划可扩展性不足、灵巧抓取多样性与穿透/稳定性权衡、数据效率与开世界泛化,以及移动操作中时间粒度、动作空间与训练-推理一致性瓶颈。目标是建立从学习型抓取、集合预测Transformer、扩散策略到大型VLM-based VLA的方法全景,支撑具身智能操作能力。

  • 纯移动导航或路径规划(不含操作)
  • 车辆动力学/横摆力矩控制等非操作领域
  • 硬件设计细节或非学习经典控制律的完整推导
  • 未给出实验数值的具体SOTA指标编造
  • foundations — 需具备机器人学基础、点云/视觉表示、基本学习与优化概念,以理解抓取姿态与策略学习
  • embodied-capabilities — 操作是具身能力核心,需衔接世界模型与长时程任务
  • vla-models — 大量近期工作依赖VLA架构,需了解视觉语言动作基础
术语 含义 常见混淆
灵巧抓取(Dexterous Grasping) 用多指/高自由度手预测多样姿态(旋转、平移、关节角),实现稳定抓取与后续操作 易与简单平行夹爪抓取混淆,后者自由度低、多样性需求不同
集合预测(Set Prediction) 一次性输出一组无序抓取姿态,用匹配损失训练,避免顺序依赖 与回归单姿态或采样方法混淆;Hungarian匹配不稳定易导致坍塌
Vision-Language-Action (VLA) 将视觉与语言输入映射为机器人动作序列的端到端或层次模型,支持语言条件操作 易与纯VLM或独立策略混淆;分单体与层次化范式
Diffusion Policy 通过动作扩散过程学习视觉运动策略,生成多模态动作分布 与直接回归或离散动作分类混淆;强调噪声逐步去噪生成
目标条件策略(Goal-Conditioned Policy) 以目标姿态/状态为条件生成抓取或操作动作,支持多样提案后精炼 与无条件生成或纯规划混淆
中间潜在动作 在世界动作模型中用于时间粒度对齐的中间表示,连接粗细动作 与直接低层控制或高层规划混淆

早期依赖经典运动规划与分析抓取质量度量;转向学习型抓取(从演示/仿真数据)与软手灵巧操作。近年引入Transformer集合预测一次生成多样姿态,解决匹配不稳定;扩散策略与VLA模型实现视觉-语言到动作的端到端/层次映射,强调数据效率、开世界泛化与移动-操作统一。范式从刚性任务规格转向语言条件、多样提案与世界模型对齐。

  1. A Survey on Learning-Based Robotic Grasping(精读)— 奠基性综述,系统梳理学习型抓取方法、数据与挑战,建立领域基础认知
  2. Dexterous Grasp Transformer(中文笔记)— 将灵巧抓取建模为集合预测,用Transformer解码器+可学习查询一次输出多样姿态,提出渐进匹配与测试时适应解决坍塌与穿透问题,有中文笔记
  3. Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey(中文笔记)— 首个大型VLM-based VLA操作综述,定义单体/层次化范式、数据集与开放挑战,提供全景与方向,有中文笔记
  1. 先读Learning-Based Robotic Grasping综述建立抓取基础与历史脉络
  2. 精读UniDexGrasp与Dexterous Grasp Transformer理解多样提案生成与集合预测/Transformer方法
  3. 阅读Diffusion Policy掌握现代视觉运动策略学习
  4. 结合Large VLM-based VLA Survey与TinyVLA梳理VLA范式与数据效率
  5. 选读软手演示学习与移动操作相关(如MoManipVLA)扩展到通用场景,交叉参考ABot-M0.5笔记
Paper 输入 输出 表示 训练目标
Dexterous Grasp Transformer 完整物体点云 一组N个多样高质量灵巧抓取姿态(旋转、平移、关节角) Transformer解码器+可学习抓取查询,集合预测 一次前向多样姿态,解决Hungarian不稳定与穿透,质量与多样性平衡
UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy 多样抓取提案+目标条件策略精炼 通用灵巧抓取,学习多样提案生成与目标条件策略
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion 视觉观察 动作序列/分布 扩散过程生成动作 视觉运动策略学习,捕获多模态动作
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey 视觉+语言 机器人动作 单体(单/双系统)或层次化VLA 开世界泛化操作,分类范式与挑战
TinyVLA: Toward Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation 轻量高效VLA 快速、数据高效的操作VLA
  • 集合预测中匹配不稳定导致模型坍塌或抓取穿透物体
  • 仿真到真实迁移(sim2real)差距,尤其高自由度手与接触动力学
  • VLA数据效率低与推理延迟,难以实时长时程操作
  • 多样姿态与稳定性/可行性权衡不足,导致执行失败
  • 移动-操作统一中时间粒度与动作空间不匹配
  • 开世界新颖物体/场景泛化失败
  • 如何在大型VLA中进一步提升数据效率与推理速度同时保持泛化
  • 灵巧抓取集合预测如何更好融合物理可行性与语言条件
  • 世界动作模型如何统一移动与细粒度操作的时间与表示对齐
  • 扩散策略与Transformer集合方法如何互补或统一于VLA框架
  • 开世界操作中的持续学习与人机协作对话框架可扩展性
  1. 灵巧抓取集合预测中Hungarian匹配不稳定会导致什么问题?如何缓解?
  2. 简述VLA模型在机器人操作中的两大主要架构范式及其特点。
  3. Diffusion Policy与直接动作回归的主要区别是什么?
  4. 从学习型抓取综述到Transformer/VLA,操作方法范式发生了哪些关键变迁?
  5. 实现通用移动操作时,时间粒度、动作空间与训练-推理一致性分别面临什么瓶颈?

本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
watch Grasp and Motion Planning for Dexterous Manipulation for the Real Robot Challenge 2021 auto score=46
recent Dexterous Grasp Transformer 2024 auto refresh 2026-07-19 sources=arxiv
recent Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey 2025 auto refresh 2026-07-19 sources=arxiv
watch BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models 2025 auto refresh 2026-07-19 sources=arxiv
watch A Conversational Framework for Human-Robot Collaborative Manipulation with Distributed Generative AI models 2026 auto score=49
watch ABot-M0.5: Unified Mobility-and-Manipulation World Action Model 2026 cross-topic assign from registry title match=1 keywords; 202
foundational A Survey on Learning-Based Robotic Grasping 2020 Survey on learning-based robotic grasping
watch A direct yaw moment control frame through model predictive control considering vehicle trajectory tracking performance and handling stability for autonomous driving 2024 cross-topic assign from registry title match=1 keywords; 202
recent UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy 2023 CVPR 2023 UniDexGrasp — universal dexterous grasping
recent MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation 2025 auto refresh 2026-07-19 sources=openalex,crossref
foundational Learning dexterous manipulation for a soft robotic hand from human demonstrations 2016 IROS 2016 dexterous soft-hand manipulation from human demos
foundational TinyVLA: Toward Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation 2025 auto refresh 2026-07-19 sources=openalex
watch Learning high-DOF reaching-and-grasping via dynamic representation of gripper-object interaction 2022 auto refresh 2026-07-19 sources=openalex
watch Foundation models in robotics: Applications, challenges, and the future 2024 auto refresh 2026-07-19 sources=openalex
recent Diffusion Policy: Visuomotor Policy Learning via Action Diffusion 2023 Diffusion Policy is a primary modern visuomotor manipulation
watch Data-Driven Robotics: Vision–Language–Action Learning for Robust Manipulation and Autonomy 2026 auto score=40

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 0 · 待获取 PDF 3)

Section titled “基础必读(选题 3 · 可学习 0 · 待获取 PDF 3)”

本档尚无可学习正文(PDF/中文笔记);下列为待获取选题。

  • A Survey on Learning-Based Robotic Grasping (2020) · 待获取 PDF
  • Learning dexterous manipulation for a soft robotic hand from human demonstrations (2016) · 待获取 PDF
  • TinyVLA: Toward Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation (2025) · 待获取 PDF

近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)

Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”

观察清单(选题 8 · 可学习 6 · 待获取 PDF 2)

Section titled “观察清单(选题 8 · 可学习 6 · 待获取 PDF 2)”

成熟度 seed · 内容数 16 · 论文池 16