跳转到内容

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

Section titled “EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems”

⚠️ AI 生成 · 建议对照原文 本页为自动整理的学习笔记;关键数据与引用如需引用,请回查 PDF / 官方版本。

学习档位 中文笔记

类型 文献 · 更新 2026-07-19

所属 具身智能体 · 基准、评测与安全

中文学习笔记(自动生成,需核验)

Section titled “中文学习笔记(自动生成,需核验)”

Topic: embodied-agents · Tier: recent · Year: 2026 · Venue:
Evidence level: partial · 本地全文: 是 · 建议阅读: ~50 分钟
Paper: https://arxiv.org/abs/2604.11174
Code:
Generator: grok

当前具身智能评测几乎只看任务成功率,却几乎不测系统是否可治理。本文把「治理」立为与任务能力并列的一等评测目标,给出七维治理基准框架(未授权能力调用、运行时漂移、恢复、策略可移植、升级安全、人机覆盖、审计完整性),适合做运行时/舰队/可升级具身系统的评估设计参考。

EmbodiedGovBench 用七维治理压力测试回答:机器人在执行、失败与演进中是否仍可控、可恢复、可审计、可演进安全,而非仅「能不能完成任务」。

现有具身基准以完成率、轨迹效率、操作精度等任务成功指标为主,无法衡量系统在能力非法调用、运行时退化、恢复范围、跨上下文策略有效性、版本升级、人类介入及时性与审计完备性等方面的可治理性;系统可能在任务指标上看起来很强,却在部署中脆弱或治理盲区。

具身智能/机器人学习评测基础;模块化运行时与能力接口概念;安全 RL / 运行时保障 / 人机协同粗略了解;对策略约束、升级与审计等运维治理问题有基本认识。

  • 将具身治理确立为区别于普通任务成功评测的一等基准目标
  • 定义七个治理维度:未授权能力调用、运行时漂移鲁棒性、恢复成功、策略可移植性、版本升级安全、人类覆盖响应、审计完整性
  • 提出覆盖单机与舰队设定的基准结构:场景模板、扰动算子、指标族与评分原则
  • 描述如何在模块化具身运行时与联邦舰队架构上实例化该基准,提供治理导向的跨系统比较协议初稿

先界定「治理」为运行时对授权边界、策略约束、恢复范围、跨上下文/版本约束、人类覆盖与可审计轨迹的可度量执行与可验证性;再围绕七维设计场景模板与扰动算子,在单机与舰队设定下施加能力合法性、运行时状态、恢复结构、策略移植、升级、人工介入与审计压力;通过治理指标与组合敏感测试(能力链在版本/策略变更后是否仍有效)评估系统是否仍为可治理的操作基座,而非仅结果层成功打分。

七维相互独立表述但实践中常交织(如未授权调用可同时是策略移植失败;升级失败可导致审计残缺)。强调 can do 与 may do 的区分;扰动导向、轨迹级评测而非单纯结果评分;可在带模块化能力接口与契约感知升级工作流的具身运行时上实例化;舰队设定下委托、多主体审计与单机定性不同。设计取舍:不宣称穷尽所有治理关切,而是覆盖部署关键、且对常规任务基准几乎不可见的失败模式集合。

摘录中给出基准结构(单机/舰队、场景模板、扰动算子、治理指标与基线协议),未给出具体数据集规模或划分细节。示例指标包括:未授权调用率(UIR)、漂移相关 DDR、局部恢复遏制率(LRCR)、策略可移植分数(PS)、升级安全执行率/UDR、人类覆盖时延(OL)、审计完整性分数(ACS)等;另含被阻能力绕过计数、信任范围违规率、退化状态策略违规、不安全恢复尝试、升级诱导策略不匹配、主归因准确率等。组合敏感测试用于版本/策略变更下能力链有效性。具体实例化数据与完整协议细节待来源核验。

提供摘录范围内未包含实证实验结果、与基线系统的定量对比或消融数字;论文定位为治理评测框架与测量层,分析性主张为「治理应成为领域一等评测目标」。定量主结果:待来源核验。

上游 ECM/运行时系列论文部分尚未完成正式同行评审(文中透明度说明);基准自洽可独立评估但与架构提案相关。摘录止于维度交互讨论,未呈现完整协议实现、基线数字与失败案例统计。治理维度不等于穷尽安全/法规全部问题;可能与任务性能存在取舍。适用边界:面向模块化、可升级、可配置、需策略/恢复/审计的具身部署系统;对纯静态、不可升级演示策略的增益有限。完整局限与适用边界待来源核验。

与前序 / 同期 / 后续方法的关系

Section titled “与前序 / 同期 / 后续方法的关系”

互补而非替代传统具身任务基准(导航、操作、VLA、长程指令、多机规划等)与安全基准(SafeAgentBench、AGENTSAFE、IS-Bench、BadRobot、Agent-SafetyBench、EARBench 等危害规避向);区别于安全 RL(学习期约束满足)与运行时保障/形式化验证(机制本身),本文提供「机制是否在压力下真正体现」的评测层;呼应 AI 治理/法规(如 EU AI Act、NIST AI RMF、ISO/IEEE 透明度与人机监督要求)的可度量落地;人机覆盖与舰队协调承接监督控制与多机协调文献。同期相关任务/安全基准未系统覆盖漂移、恢复治理、策略移植、升级安全与审计完整性的组合。

官方代码仓库:https://github.com/s20sc/embodied-gov-bench ;项目页:https://s20sc.github.io/aeros-project 。复现建议:按七维场景模板与扰动算子在目标运行时接入能力接口与审计轨迹;优先跑未授权调用与升级/链存活测试,再扩展漂移、恢复与人机覆盖;记录轨迹级指标而非仅任务成功。具体安装与基线脚本细节待来源核验。

摘要与图1(任务成功 vs 治理)→ 引言四贡献与治理定义 → §3 七维(动机/基准问题/示例指标)与表1 → 相关工作定位 → 后续(摘录未含)场景模板、扰动、协议与任何实验/实例化章节 → 结论与和 ECM 系列关系。

  1. Q: EmbodiedGovBench 相对传统具身基准的核心问题转换是什么? A: 从「机器人能不能做完任务」转为「在做的同时是否仍可治理(可控、策略有界、可恢复、可审计、演进安全)」。
  2. Q: 文中定义的七个治理维度分别是什么? A: 未授权能力调用、运行时漂移鲁棒性、恢复成功、策略可移植性、版本升级安全、人类覆盖(时延/响应)、审计完整性。
  3. Q: 为什么治理不能简单归约为一个「安全」标量或从任务成功率推断? A: 任务成功时仍可能违规调用能力、静默退化、不安全恢复或审计残缺;治理良好系统也可能为守策略而牺牲部分任务性能;失败常跨多维交织。
  4. Q: 「未授权能力调用」维度要区分的核心概念是什么? A: can do(能做)与 may do(被允许做):能力在场但受任务/策略/信任/具身上下文条件限制时是否只调用授权能力。
  5. Q: 组合敏感测试主要测什么? A: 能力链在版本与策略变更后是否仍然合法有效(post-upgrade chain survival 等),而非单点任务结果。
  • page 1 / Abstract: Rather than asking only whether a robot can complete a task, EmbodiedGovBench evaluates whether the system remains controllable, policy-bounded, recoverable, auditable, and evolution-safe under realistic capability and runtime perturbations.
  • page 1 / Abstract: The benchmark covers seven governance dimensions: unauthorized capability invocation, runtime drift, recovery success, policy portability across simulation and deployment contexts, version upgrade safety, human override responsiveness, and audit completeness.
  • page 2 / Contributions: We identify embodied governance as a first-class benchmark target distinct from ordinary task-success evaluation.
  • page 2 / Introduction: By governance we mean the measurable ability of a runtime system to enforce authorization boundaries on capability use, maintain policy-bounded behavior under perturbation, recover from failure at appropriate scope, preserve constraint validity across context and version changes, support timely human override, and produce auditable execution traces.
  • page 3 / Figure 1 caption: Traditional embodied benchmarks (left) measure what robots can do. EmbodiedGovBench (right) measures whether their capabilities remain governable under execution, failure, and evolution.
  • page 5 / §3.1: A robot may succeed on a task while violating policy, using the wrong capability, degrading silently, recovering unsafely, or producing incomplete operational traces.
  • page 8 / Table 1: Dimension | What It Measures | Example Failure | Key Metric … Unauthorized Invocation … UIR … Audit Completeness … ACS
  • page 1 footer / Keywords area: Code: https://github.com/s20sc/embodied-gov-bench.

生成:2026-07-21 · 来源条数 2 · 模型 heuristic · 需人工核验数字

围绕「EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems」的核心问题与动机(待结合全文核验)。

  • 见原文方法章节;以下为基于摘要/摘录的要点提示。
  • EmbodiedGovBench: A Benchmark for Governance, Recovery, …

与相近工作的关系待核验;请对照 related work。

  • 勿仅凭摘要推断未给出的数值指标。
  1. 这篇工作的输入/输出表示是什么?(EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems)
  2. 训练目标与评测协议各是什么?
  3. 主要失败模式或局限是什么?
flowchart LR
A["输入 / 观测"] --> B["表示 / 编码"]
B --> C["推理 / 解码"]
C --> D["输出 / 动作或检测"]
%% method sketch for: EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Em

方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems arch p.1

来源:原论文约 p.1(arch);学习用途摘录。

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems table p.8

来源:原论文约 p.8(table);学习用途摘录。

展开英文 Paper Card / AI deep analysis
Field Content
Year 2026
Authors Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li
arXiv 2604.11174
DOI
Topics embodied-agents, benchmark-eval-safety
Paper https://arxiv.org/abs/2604.11174
展开 Extract / Selections / Local assets
  • embodied-agents: tier=recent rank=3 score=58 — auto refresh 2026-07-19 sources=arxiv
  • benchmark-eval-safety: tier=watch rank=2 score=57 — cross-topic assign from registry title match=2 keywords; 2026-07-19
EmbodiedGovBench: A Benchmark for Governance,
Recovery,
and Upgrade Safety in Embodied Agent Systems*
Xue Qin1 Simin Luan2 John See3 Cong Yang4,∗ Zhijun Li2,∗
1
School of Software, Harbin Institute of Technology, Harbin, China
2
School of Computer Science and Technology, Harbin Institute of Technology, Harbin, China
3
School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus, Putrajaya, Malaysia
arXiv:2604.11174v1 [cs.RO] 13 Apr 2026
4
School of Future Science and Engineering, Soochow University, Suzhou, China
qinxue@me.com luansiminiot@gmail.com J.See@hw.ac.uk
cong.yang@suda.edu.cn lizhijunos@hit.edu.cn
Corresponding authors
Abstract
Recent progress in embodied AI has produced a growing ecosystem of robot policies, founda-
tion models, embodied agents, and modular runtimes. However, current evaluation practice remains
dominated by task success metrics such as completion rate, trajectory efficiency, or manipulation
accuracy. These metrics are important, but they leave a critical gap: they do not measure whether
embodied systems are governable. In particular, existing benchmarks rarely test unauthorized ca-