跳转到内容

IROSA: Interactive Robot Skill Adaptation using Natural Language

IROSA: Interactive Robot Skill Adaptation using Natural Language

Section titled “IROSA: Interactive Robot Skill Adaptation using Natural Language”

⚠️ AI 生成 · 建议对照原文 本页为自动整理的学习笔记;关键数据与引用如需引用,请回查 PDF / 官方版本。

学习档位 中文笔记

类型 文献 · 更新 2026-07-19

所属 VLA 模型

中文学习笔记(自动生成,需核验)

Section titled “中文学习笔记(自动生成,需核验)”

Topic: vla-models · Tier: recent · Year: 2026 · Venue:
Evidence level: partial · 本地全文: 是 · 建议阅读: ~40 分钟
Paper: https://arxiv.org/abs/2603.03897
Code:
Generator: grok

该工作将预训练大语言模型的工具调用能力与核化运动原语(KMP)模仿学习框架结合,构建严格分离语言理解与机器人控制的工具式架构,实现工业场景下开放词汇、零样本、可解释且无需微调的机器人技能适应,兼顾安全与可部署性,对工业具身智能与人机交互研究具有直接参考价值。

IROSA 通过 LLM 选择并参数化预定义工具来修改 KMP,实现自然语言驱动的机器人技能适应,无需微调且保持硬件保护抽象层。

如何让非专家用户通过自然语言直观适应机器人技能(尤其是工业任务中的速度调整、轨迹修正与避障),同时保持可解释、可验证、可预测的行为,并严格分离语言理解与底层机器人控制,避免端到端方法在安全、可解释性与工业合规上的不足。

大语言模型 function calling / 工具调用;从演示学习(LfD)与概率运动原语;Kernelized Movement Primitives(KMP)的参考轨迹分布、via-point 约束与核方法;工业机器人力矩控制与技能适应基础。

  • 提出工具式架构,通过结构化 function calling 实现零样本自然语言机器人技能适应,严格分离语言理解与机器人控制。
  • 对 KMP 进行扩展,支持自然语言驱动的速度调制以及基于排斥场的避障,超越传统 via-point 约束。
  • 在 7-DoF 力矩控制 DLR SARA 机器人上对工业轴承环插入任务进行实验验证,展示无需模型微调或迭代用户反馈的可靠可解释技能适应。

从 kinesthetic teaching 演示学习 KMP 参考轨迹分布;用户观察执行后给出自然语言指令;系统接收指令、环境观测(物体位置/尺寸/语义标签)与可选描述;LLM 基于工具 JSON schema 进行工具选择与参数化;参数经范围与安全验证后,工具修改 KMP 内部表示(速度调制、via-point 插入、排斥点生成等);执行修改后的技能并反馈。整体为五步工作流:User Query → Tool Selection → Tool Parameterization → Tool Execution → Feedback。

1)工具层与保护抽象:LLM 只能选择并参数化预定义、已验证的工具,禁止直接生成轨迹或访问硬件;2)执行模型 KMP:非参数概率模仿学习,支持 via-point 与时序适应,从少量演示(2–5 次)学习;3)核心适应工具:Speed Modulation(修改轨迹段时间间隔实现加速/减速)、Via-Point Insertion(空间轨迹修正)、Repulsion Point Generation(排斥场避障);4)参数验证:类型与安全边界检查(如速度变化 ±200% 内),失败时给出 refinement 反馈;5)环境信息:当前实现手动提供物体观测,支持 6-DoF 但评估侧重位置。取舍在于用受限工具保证安全与可解释,换取相对端到端/代码生成方法更强的工业可部署性与本地 LLM 支持。

演示数据:kinesthetic teaching 获得的演示集 D,用于学习 KMP;任务场景:7-DoF 力矩控制 DLR SARA 机器人执行工业轴承环插入;环境观测为物体位置、尺寸与语义标签(手动提供);指标与详细实验设置在提供摘录中未完整给出,待来源核验。

在工业轴承环插入任务上展示了通过自然语言命令成功进行速度调整、轨迹修正与障碍物规避的技能适应,并保持安全、透明与可解释性;无需模型微调或迭代用户反馈即可实现可靠适应。具体定量指标与对比数字在提供摘录中不足,待来源核验。

环境观测当前为手动提供(虽可扩展自动感知);评估主要聚焦位置适应(姿态示例见补充视频);依赖预定义工具集,抽象行为能力受工具覆盖限制;与需要重训练/仿真优化/代码生成的方法相比,灵活性受工具设计约束;工业结构化环境假设较强。失败场景与完整适用边界细节待来源核验。

与前序 / 同期 / 后续方法的关系

Section titled “与前序 / 同期 / 后续方法的关系”

概率运动原语方面:相对 GMM、ProMP,KMP 更易处理 via-point 且无需基函数定义,并引用 TP-KMP 与交互式增量学习工作。端到端语言条件控制:CLIPORT、KITE、LaTTe、OpenVLA、RoboPoint 等能力强但数据需求大、可解释性与工业安全保证有限。模块化接口:OLAF(策略重训)、Sharma 等(代价映射需离线训练)、Merlo 等(符号动作级)、Yu 等(奖励合成需仿真优化)、OVITA(代码生成有可靠性与云依赖问题)。IROSA 定位为工具式 + KMP,训练免费、开放词汇、零样本、可解释且支持本地 LLM,在 Table I 中与上述方法对比。

官方代码:https://github.com/DLR-RM/IROSA。复现建议:准备少量 kinesthetic 演示学习 KMP;配置支持 function calling 的本地或 API LLM;定义工具 JSON schema(速度、via-point、排斥点等);在力矩控制机械臂上按五步工作流测试自然语言指令;注意参数安全边界与手动/自动环境观测接口。完整实验配置待来源核验。

先读 Abstract 与 Introduction 把握动机与贡献;再读 Related Work 与 Table I 理解定位;接着 Preliminaries 复习 KMP 公式与 via-point 机制;然后 Approach 的 Problem Formulation 与 Five-Step Workflow 及工具细节;最后 Experiments(摘录未全)与补充材料验证结果。

  1. Q: IROSA 如何保证 LLM 不直接控制机器人硬件? A: 采用工具式架构与保护抽象层:LLM 仅通过 function calling 选择并参数化预定义、已验证的工具,由工具修改 KMP 表示后再执行,严格分离语言理解与机器人控制。
  2. Q: 系统支持哪三类主要工业相关适应? A: Speed Modulation(速度调制)、Via-Point Insertion(via-point 插入进行空间修正)、Repulsion Point Generation(排斥点生成实现避障)。
  3. Q: 为什么选择 KMP 作为底层运动表示? A: KMP 是非参数概率模仿学习框架,从少量演示即可学习,支持 via-point 与时序适应,具有解析不确定性表达,便于工具无缝注入自然语言指定的约束,且行为确定可解释。
  4. Q: 五步工作流依次是什么? A: User Query(用户指令)、Tool Selection(LLM 选工具)、Tool Parameterization(参数化)、Tool Execution(修改 KMP 并执行)、Feedback(反馈)。
  5. Q: 与 OVITA 或 OLAF 相比,IROSA 的主要优势是什么? A: 无需代码生成可靠性问题与云依赖(相对 OVITA),无需策略重训(相对 OLAF);实现训练免费、零样本、可解释且支持本地 LLM 的直接轨迹级适应。
  • page 1 Abstract: We present a novel framework that enables open-vocabulary skill adaptation through a tool-based architecture maintaining a protective abstraction layer between the language model and robot hardware.
  • page 1 Abstract: We demonstrate the framework on a 7-DoF torque-controlled robot performing an industrial bearing ring insertion task, showing successful skill adaptation through natural language commands for speed adjustment, trajectory correction, and obstacle avoidance while maintaining safety, transparency, and interpretability.
  • page 1–2 Introduction / Contributions: 1) A tool-based architecture that enables zero-shot natural language adaptation of robot skills through structured function calling, maintaining strict separation between language understanding and robot control. 2) Novel extensions to KMPs for natural language-driven speed modulation and obstacle avoidance via repulsion fields… 3) Experimental validation … without model fine-tuning or iterative user feedback.
  • page 3 Table I caption / comparison: Ours Tool-based ✓ ✓ ✓ ✓ ✓ (Training-Free, Open Vocab., Zero-Shot, Explainable, Local LLM)
  • page 3–4 Approach / Five-Step Workflow: The system processes commands through the workflow illustrated in Fig. 1: (1) User Query, (2) Tool Selection, (3) Tool Parameterization, (4) Tool Execution, and (5) Feedback.
  • page 1 footer / code: Code available at: https://github.com/DLR-RM/IROSA
  • page 4 Tool Execution: • Speed Modulation: Adjusts the execution speed of trajectory segments by modifying the time intervals between trajectory points. … • Via-point … • Repulsion …
  • topic: application-domains
  • sources: arxiv
  • retrieved_at: 2026-07-20
  • query: embodied AI applications survey robotics
  • arxiv: 2603.03897
  • doi: 10.1109/LRA.2026.3671560
  • score_total: 37
  • suggested_tier: watch

(no prose relevance explanation — numeric score only or HTTP source)

(no snippet evidence in candidate pool)

生成:2026-07-21 · 来源条数 2 · 模型 heuristic · 需人工核验数字

围绕「IROSA: Interactive Robot Skill Adaptation using Natural Language」的核心问题与动机(待结合全文核验)。

  • 见原文方法章节;以下为基于摘要/摘录的要点提示。
  • IEEE ROBOTICS AND AUTOMATION LETTERS. PREPRINT VERSION. ACCEPTED FEBRUARY, 2026 1 …

与相近工作的关系待核验;请对照 related work。

  • 勿仅凭摘要推断未给出的数值指标。
  1. 这篇工作的输入/输出表示是什么?(IROSA: Interactive Robot Skill Adaptation using Natural Language)
  2. 训练目标与评测协议各是什么?
  3. 主要失败模式或局限是什么?
flowchart LR
A["输入 / 观测"] --> B["表示 / 编码"]
B --> C["推理 / 解码"]
C --> D["输出 / 动作或检测"]
%% method sketch for: IROSA: Interactive Robot Skill Adaptation using Natural Language

方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。

IROSA: Interactive Robot Skill Adaptation using Natural Language arch p.1

来源:原论文约 p.1(arch);学习用途摘录。

IROSA: Interactive Robot Skill Adaptation using Natural Language qualitative p.5

来源:原论文约 p.5(qualitative);学习用途摘录。

展开英文 Paper Card / AI deep analysis
Field Content
Year 2026
Authors Markus Knauer, Samuel Bustamante, Thomas Eiband, Alin Albu-Schäffer, Freek Stulp, João Silvério
arXiv 2603.03897
DOI 10.1109/LRA.2026.3671560
Topics vla-models
Paper https://arxiv.org/abs/2603.03897
展开 Extract / Selections / Local assets
  • vla-models: tier=recent rank=2 score=45 — auto refresh 2026-07-19 sources=arxiv
IEEE ROBOTICS AND AUTOMATION LETTERS. PREPRINT VERSION. ACCEPTED FEBRUARY, 2026 1
IROSA: Interactive Robot Skill Adaptation using
Natural Language
Markus Knauer 1,2 (IEEE Student Member), Samuel Bustamante 1,2 , Thomas Eiband 1 ,
Alin Albu-Schäffer 1,2 (IEEE Fellow), Freek Stulp 1 and João Silvério 1 (IEEE Member)
Abstract—Foundation models have demonstrated impressive
capabilities across diverse domains, while imitation learning pro-
vides principled methods for robot skill adaptation from limited
data. Combining these approaches holds significant promise for
arXiv:2603.03897v3 [cs.RO] 16 Apr 2026
direct application to robotics, yet this combination has received
limited attention, particularly for industrial deployment. We
present a novel framework that enables open-vocabulary skill
adaptation through a tool-based architecture maintaining a pro-
tective abstraction layer between the language model and robot
hardware. Our approach leverages pre-trained LLMs to select
and parameterize specific tools for adapting robot skills without
requiring fine-tuning or direct model-to-robot interaction. We
demonstrate the framework on a 7-DoF torque-controlled robot
performing an industrial bearing ring insertion task, showing
successful skill adaptation through natural language commands Fig. 1: Overview of our approach Interactive RObot Skill Adaptation using
natural language. Showing the inter