机器人操作
机械臂抓取、操作与接触丰富控制的策略与表征。
类型 Topics · 更新 2026-07-20
本 Topic 要解决什么
Section titled “本 Topic 要解决什么”本Topic聚焦机器人操作核心挑战:在非结构化环境中实现可靠抓取与灵巧操作,覆盖从物体点云/视觉输入预测多样高质量抓取姿态、高自由度手部动作生成,到结合视觉-语言-动作(VLA)模型实现语言条件下的通用操作。关键问题包括传统刚性规划可扩展性不足、灵巧抓取多样性与穿透/稳定性权衡、数据效率与开世界泛化,以及移动操作中时间粒度、动作空间与训练-推理一致性瓶颈。目标是建立从学习型抓取、集合预测Transformer、扩散策略到大型VLM-based VLA的方法全景,支撑具身智能操作能力。
非目标 / 边界
Section titled “非目标 / 边界”- 纯移动导航或路径规划(不含操作)
- 车辆动力学/横摆力矩控制等非操作领域
- 硬件设计细节或非学习经典控制律的完整推导
- 未给出实验数值的具体SOTA指标编造
foundations— 需具备机器人学基础、点云/视觉表示、基本学习与优化概念,以理解抓取姿态与策略学习embodied-capabilities— 操作是具身能力核心,需衔接世界模型与长时程任务vla-models— 大量近期工作依赖VLA架构,需了解视觉语言动作基础
| 术语 | 含义 | 常见混淆 |
|---|---|---|
| 灵巧抓取(Dexterous Grasping) | 用多指/高自由度手预测多样姿态(旋转、平移、关节角),实现稳定抓取与后续操作 | 易与简单平行夹爪抓取混淆,后者自由度低、多样性需求不同 |
| 集合预测(Set Prediction) | 一次性输出一组无序抓取姿态,用匹配损失训练,避免顺序依赖 | 与回归单姿态或采样方法混淆;Hungarian匹配不稳定易导致坍塌 |
| Vision-Language-Action (VLA) | 将视觉与语言输入映射为机器人动作序列的端到端或层次模型,支持语言条件操作 | 易与纯VLM或独立策略混淆;分单体与层次化范式 |
| Diffusion Policy | 通过动作扩散过程学习视觉运动策略,生成多模态动作分布 | 与直接回归或离散动作分类混淆;强调噪声逐步去噪生成 |
| 目标条件策略(Goal-Conditioned Policy) | 以目标姿态/状态为条件生成抓取或操作动作,支持多样提案后精炼 | 与无条件生成或纯规划混淆 |
| 中间潜在动作 | 在世界动作模型中用于时间粒度对齐的中间表示,连接粗细动作 | 与直接低层控制或高层规划混淆 |
方法谱系与时间线
Section titled “方法谱系与时间线”早期依赖经典运动规划与分析抓取质量度量;转向学习型抓取(从演示/仿真数据)与软手灵巧操作。近年引入Transformer集合预测一次生成多样姿态,解决匹配不稳定;扩散策略与VLA模型实现视觉-语言到动作的端到端/层次映射,强调数据效率、开世界泛化与移动-操作统一。范式从刚性任务规格转向语言条件、多样提案与世界模型对齐。
- (2016) foundational — Learning dexterous manipulation for a soft robotic hand from human demonstrations
- (2020) foundational — A Survey on Learning-Based Robotic Grasping
- (2021) watch — Grasp and Motion Planning for Dexterous Manipulation for the Real Robot Challenge
- (2022) watch — Learning high-DOF reaching-and-grasping via dynamic representation of gripper-object interaction
- (2023) recent — UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy
- (2023) recent — Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- (2024) recent — Dexterous Grasp Transformer
- (2024) watch — A direct yaw moment control frame through model predictive control considering vehicle trajectory tracking performance and handling stability for autonomous driving
- (2024) watch — Foundation models in robotics: Applications, challenges, and the future
- (2025) foundational — TinyVLA: Toward Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- (2025) recent — Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
- (2025) watch — BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models
- (2025) recent — MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation
- (2026) watch — A Conversational Framework for Human-Robot Collaborative Manipulation with Distributed Generative AI models
- (2026) watch — ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
- (2026) watch — Data-Driven Robotics: Vision–Language–Action Learning for Robust Manipulation and Autonomy
- A Survey on Learning-Based Robotic Grasping(精读)— 奠基性综述,系统梳理学习型抓取方法、数据与挑战,建立领域基础认知
- Dexterous Grasp Transformer(中文笔记)— 将灵巧抓取建模为集合预测,用Transformer解码器+可学习查询一次输出多样姿态,提出渐进匹配与测试时适应解决坍塌与穿透问题,有中文笔记
- Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey(中文笔记)— 首个大型VLM-based VLA操作综述,定义单体/层次化范式、数据集与开放挑战,提供全景与方向,有中文笔记
推荐阅读路径
Section titled “推荐阅读路径”- 先读Learning-Based Robotic Grasping综述建立抓取基础与历史脉络
- 精读UniDexGrasp与Dexterous Grasp Transformer理解多样提案生成与集合预测/Transformer方法
- 阅读Diffusion Policy掌握现代视觉运动策略学习
- 结合Large VLM-based VLA Survey与TinyVLA梳理VLA范式与数据效率
- 选读软手演示学习与移动操作相关(如MoManipVLA)扩展到通用场景,交叉参考ABot-M0.5笔记
| Paper | 输入 | 输出 | 表示 | 训练目标 |
|---|---|---|---|---|
| Dexterous Grasp Transformer | 完整物体点云 | 一组N个多样高质量灵巧抓取姿态(旋转、平移、关节角) | Transformer解码器+可学习抓取查询,集合预测 | 一次前向多样姿态,解决Hungarian不稳定与穿透,质量与多样性平衡 |
| UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy | — | 多样抓取提案+目标条件策略精炼 | — | 通用灵巧抓取,学习多样提案生成与目标条件策略 |
| Diffusion Policy: Visuomotor Policy Learning via Action Diffusion | 视觉观察 | 动作序列/分布 | 扩散过程生成动作 | 视觉运动策略学习,捕获多模态动作 |
| Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey | 视觉+语言 | 机器人动作 | 单体(单/双系统)或层次化VLA | 开世界泛化操作,分类范式与挑战 |
| TinyVLA: Toward Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation | — | — | 轻量高效VLA | 快速、数据高效的操作VLA |
工程实现与复现风险
Section titled “工程实现与复现风险”- 集合预测中匹配不稳定导致模型坍塌或抓取穿透物体
- 仿真到真实迁移(sim2real)差距,尤其高自由度手与接触动力学
- VLA数据效率低与推理延迟,难以实时长时程操作
- 多样姿态与稳定性/可行性权衡不足,导致执行失败
- 移动-操作统一中时间粒度与动作空间不匹配
- 开世界新颖物体/场景泛化失败
- 如何在大型VLA中进一步提升数据效率与推理速度同时保持泛化
- 灵巧抓取集合预测如何更好融合物理可行性与语言条件
- 世界动作模型如何统一移动与细粒度操作的时间与表示对齐
- 扩散策略与Transformer集合方法如何互补或统一于VLA框架
- 开世界操作中的持续学习与人机协作对话框架可扩展性
Topic 自测清单
Section titled “Topic 自测清单”- 灵巧抓取集合预测中Hungarian匹配不稳定会导致什么问题?如何缓解?
- 简述VLA模型在机器人操作中的两大主要架构范式及其特点。
- Diffusion Policy与直接动作回归的主要区别是什么?
- 从学习型抓取综述到Transformer/VLA,操作方法范式发生了哪些关键变迁?
- 实现通用移动操作时,时间粒度、动作空间与训练-推理一致性分别面临什么瓶颈?
选篇附录(registry)
Section titled “选篇附录(registry)”本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。
论文池(FRW)
Section titled “论文池(FRW)”来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5。
可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。
基础必读(选题 3 · 可学习 0 · 待获取 PDF 3)
Section titled “基础必读(选题 3 · 可学习 0 · 待获取 PDF 3)”本档尚无可学习正文(PDF/中文笔记);下列为待获取选题。
- A Survey on Learning-Based Robotic Grasping (2020) · 待获取 PDF
- Learning dexterous manipulation for a soft robotic hand from human demonstrations (2016) · 待获取 PDF
- TinyVLA: Toward Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation (2025) · 待获取 PDF
近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)
Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”- UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy (2023) · 固定 · 中文笔记
- Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey (2025) · 中文笔记
- MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation (2025) · 中文笔记
- Dexterous Grasp Transformer (2024) · 中文笔记
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (2023) · 待获取 PDF
观察清单(选题 8 · 可学习 6 · 待获取 PDF 2)
Section titled “观察清单(选题 8 · 可学习 6 · 待获取 PDF 2)”- BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models (2025) · 中文笔记
- Foundation models in robotics: Applications, challenges, and the future (2024) · 精读
- ABot-M0.5: Unified Mobility-and-Manipulation World Action Model (2026) · 中文笔记
- A Conversational Framework for Human-Robot Collaborative Manipulation with Distributed Generative AI models (2026) · 中文笔记
- Grasp and Motion Planning for Dexterous Manipulation for the Real Robot Challenge (2021) · 中文笔记
- Data-Driven Robotics: Vision–Language–Action Learning for Robust Manipulation and Autonomy (2026) · 中文笔记
- Learning high-DOF reaching-and-grasping via dynamic representation of gripper-object interaction (2022) · 待获取 PDF
- A direct yaw moment control frame through model predictive control considering vehicle trajectory tracking performance and handling stability for autonomous driving (2024) · 待获取 PDF
成熟度 seed · 内容数 16 · 论文池 16