跳转到内容

决策与任务规划

高层行为决策、任务规划与行为树/有限状态策略。

类型 Topics · 更新 2026-07-19

本Topic聚焦自动驾驶与具身智能中的任务级决策与规划问题,即如何将高层指令、环境观察与长期目标转化为可执行的层次化动作序列或决策策略。传统规划依赖规则或搜索,难以应对开放、动态、多变场景;LLM驱动的具身智能体虽能生成灵活计划,但面临无关记忆噪声干扰、高层通用洞察缺失、推理延迟导致决策过时、以及闭环交互真实性不足等挑战。核心是提升规划对齐性、鲁棒性与实时性,支持长期horizon任务如指令跟随、灾害响应与自动驾驶闭环决策,连接感知输出与底层控制。

  • 底层轨迹跟踪或运动控制细节
  • 纯感知与场景理解模型训练
  • 硬件实时系统实现或部署优化
  • 非任务级的纯序列决策如MDP求解细节
  • foundations — 需掌握基本规划概念与决策理论框架,作为任务规划与层次方法的基础
  • sequential-decision — 顺序决策与MDP/POMDP基础支撑长期任务分解与策略学习
  • embodied-agents — 具身智能体架构与LLM交互机制是当前任务规划主流范式前提
术语 含义 常见混淆
任务规划 将高层目标分解为可执行子任务或动作序列的过程,常涉及符号或LLM生成 易与运动规划或轨迹生成混淆,后者更偏连续控制
层次规划 多层级抽象规划,高层决策指导低层执行,支持长期horizon 与单层端到端决策不同,强调分解与抽象
多尺度洞察 从经验中提取不同粒度(低层细节到高层通用)的记忆总结用于决策增强 不同于简单检索,强调生成与任务相关选择
快速反射-异步反思 低延迟规则/反射路径与异步LLM反思并行的混合决策架构 非纯LLM慢推理,也非纯规则,强调延迟与质量权衡
闭环规划基准 智能体决策影响环境演化并反馈的评估设置,需真实反应式交互 与开环预测不同,强调交互真实性与动态响应
具身决策接口 标准化LLM与具身环境交互的基准与评估协议 不仅是任务集,更是接口定义与决策对齐度量

早期自动驾驶与机器人规划依赖规则、搜索与启发式决策,强调可解释与安全保证。深度RL与IL引入数据驱动策略学习,但仍难处理开放指令与长期抽象。LLM时代转向语言驱动层次规划与洞察记忆增强,结合多尺度抽象与混合反射架构,从静态/忽略延迟评估转向真实动态闭环与实时异步决策。

  1. Planning and Decision-Making for Autonomous Vehicles(精读)— 经典综述奠定自动驾驶规划与决策框架基础,覆盖层次方法与核心挑战
  2. MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making(中文笔记)— 提出多尺度洞察生成与选择机制,解决记忆噪声与高层抽象缺失,直接提升具身规划决策
  3. A survey on large language model based autonomous agents(精读)— 系统梳理LLM自主智能体规划与决策范式,提供整体图谱与对比视角
  1. 先读经典AV规划决策综述建立层次框架与传统方法认知
  2. 再读LLM自主智能体综述把握范式变迁与通用架构
  3. 精读MSI-Agent理解多尺度洞察如何增强规划对齐与鲁棒
  4. 结合RRARA论文分析实时动态环境下的延迟与混合决策
  5. 对照Embodied Agent Interface与nuPlan-R等基准理解评估接口与闭环交互
Paper 输入 输出 表示 训练目标
MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making 历史经验与任务观察 多尺度洞察增强的规划与决策动作 经验选择+多尺度洞察生成与任务相关选择 提升具身智能体规划对齐性与领域偏移鲁棒性
LLM-Enhanced Rapid-Reflex Async-Reflect Embodied Agent for Real-Time Decision-Making in Dynamically Changing Environment 动态环境观察与风险场景 低延迟高质量决策动作 快速反射路径+异步LLM反思并行(RRARA) 解决推理延迟导致决策过时问题,支持实时高风险决策
Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making 具身环境状态与指令 LLM决策与执行结果 标准化接口与基准协议 系统评估LLM具身决策能力
nuPlan-R: A Closed-Loop Planning Benchmark for Autonomous Driving via Reactive Multi-Agent Simulation 自动驾驶场景与规划器输出 闭环交互仿真结果与扩展指标 噪声解耦扩散反应式多智能体+交互感知选择 构建更真实公平的闭环规划评估基准
  • LLM推理延迟导致动态环境中观察过时与决策失效
  • 长期记忆中无关洞察噪声干扰规划有效性
  • 闭环基准中规则反应式智能体过于简化交互真实性不足
  • 具身LLM智能体易被物理世界越狱攻击影响安全决策
  • 高层洞察缺失导致领域偏移下泛化差
  • 如何更高效地生成与选择真正任务相关的多尺度洞察而不引入噪声
  • 实时混合反射架构中快速路径与异步反思的最优同步与冲突解决机制
  • 闭环规划基准如何进一步逼近真实人类交互多样性与非合作行为
  • 层次任务规划中LLM生成计划的可验证性与安全约束嵌入方法
  • 跨域(自动驾驶与通用具身)决策规划表示与目标的统一框架
  1. 任务规划与运动规划的主要区别是什么?层次规划如何 bridging 二者?
  2. MSI-Agent中多尺度洞察解决了长期记忆的哪些核心问题?生成与选择机制如何工作?
  3. 为什么现有具身基准常忽略推理延迟?RRARA架构如何通过快速反射与异步反思应对?
  4. 闭环规划基准中使用规则IDM反应式智能体有何局限?nuPlan-R如何改进?
  5. LLM驱动的具身决策相比传统启发式或RL规划,主要范式优势与工程风险分别是什么?

本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
watch BadRobot: Jailbreaking Embodied LLM Agents in the Physical World 2024 cross-topic assign from registry title match=2 keywords; 202
recent MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making 2024 auto refresh 2026-07-19 sources=arxiv,crossref
watch Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making 2024 auto score=41
recent LLM-Enhanced Rapid-Reflex Async-Reflect Embodied Agent for Real-Time Decision-Making in Dynamically Changing Environments 2025 auto refresh 2026-07-19 sources=arxiv
watch nuPlan-R: A Closed-Loop Planning Benchmark for Autonomous Driving via Reactive Multi-Agent Simulation 2025 cross-topic assign from registry title match=2 keywords; 202
watch Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents 2026 cross-topic assign from registry title match=2 keywords; 202
recent A survey on large language model based autonomous agents 2024 auto refresh 2026-07-19 sources=openalex
watch Planning and control of autonomous mobile robots for intralogistics: Literature review and research agenda 2021 auto refresh 2026-07-19 sources=openalex
recent Augmenting large language models with chemistry tools 2024 auto refresh 2026-07-19 sources=openalex
watch Automatic Robot Task Planning by Integrating Large Language Model with Genetic Programming 2025 auto score=40
watch Joint Knowledge Graph Reasoning and Large Language Models for Hierarchical Task Planning 2025 auto score=40
watch RoboGPT: An LLM-Based Long-Term Decision-Making Embodied Agent for Instruction Following Tasks 2025 cross-topic assign from registry title match=3 keywords; 202
recent A Survey of Deep RL and IL for Autonomous Driving Policy Learning 2021 auto refresh 2026-07-19 sources=openalex
foundational Planning and Decision-Making for Autonomous Vehicles 2018 Annual Review planning and decision-making for AVs
foundational Heuristic Decision Making 2010 auto refresh 2026-07-19 sources=openalex
foundational Human motion trajectory prediction: a survey 2020 auto refresh 2026-07-19 sources=openalex

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)

Section titled “基础必读(选题 3 · 可学习 1 · 待获取 PDF 2)”

近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)

Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”

观察清单(选题 8 · 可学习 6 · 待获取 PDF 2)

Section titled “观察清单(选题 8 · 可学习 6 · 待获取 PDF 2)”

成熟度 seed · 内容数 16 · 论文池 16