跳转到内容

序列决策学习

在时间序列上做决策的学习范式,含强化学习与模仿/离线学习。

类型 Topics · 更新 2026-07-20

本Topic聚焦序列决策学习,解决在马尔可夫决策过程框架下如何通过策略学习、价值估计与技能分解,使智能体在长时程、稀疏奖励、部分可观测环境中生成最优或近优动作序列。核心挑战包括时序依赖建模、探索效率、子任务连接脆弱性、预测-规划-代价联合优化,以及从经典决策理论到深度RL/IL再到LLM驱动自主智能体的范式迁移。应用于自动驾驶政策学习、手术机器人长时程操作、具身智能规划等,旨在提升闭环任务成功率、鲁棒性与泛化能力,弥合单步决策与长期交互的鸿沟。基于给定书目与片段构建,未知实验细节待核验。

  • 不深入单帧感知或检测分类模型细节
  • 不覆盖纯硬件实时控制实现与部署优化
  • 不讨论非序列的静态优化问题
  • foundations — 需掌握概率图模型、优化基础与控制理论以理解MDP与规划假设
  • reinforcement-learning — 序列决策与RL紧密关联,需先熟悉基本MDP形式化与策略梯度/价值迭代概念
术语 含义 常见混淆
MDP 马尔可夫决策过程,由状态、动作、转移、奖励构成的序列决策形式化框架,满足马尔可夫性。 常与POMDP混淆,后者处理部分可观测状态
策略学习 从数据或交互中学习状态到动作映射(确定性或随机),以最大化期望累积回报。 易与单纯价值学习混淆,策略可直接或间接获得
价值函数 估计从某状态或状态-动作对出发的期望长期回报,用于指导决策与技能终止。 V函数与Q函数用途不同,前者仅状态后者含动作
技能链式连接 将长时程任务分解为子任务策略并顺序连接,依赖终止状态选择以保证下一技能可行。 粗分解易导致状态分布不匹配,价值引导可缓解
长时程任务 多步骤、持续时长长、奖励稀疏的序列决策问题,单片策略探索负担重。 与短视单步决策相对,需层次化或记忆增强方法
决策理论规划 基于期望效用最大化的结构化规划,利用问题假设实现计算杠杆。 与纯启发式搜索区分,强调概率与效用结构

早期依赖决策理论规划的结构假设与动态规划计算杠杆进行序列决策。随后转向深度强化学习与模仿学习的端到端策略学习,直接从数据优化自动驾驶等政策。近期进一步引入价值引导的技能链式连接处理长时程稀疏奖励,以及LLM驱动的多尺度洞察与统一架构自主智能体,融合世界模型与神经符号方法实现更开放的规划与决策。

  1. Decision-Theoretic Planning: Structural Assumptions and Computational Leverage(仅书目)— 奠定序列决策理论规划的核心结构假设与计算优势,是理解MDP与决策理论基础的必读经典。
  2. Planning and Decision-Making for Autonomous Vehicles(精读)— 系统综述自动驾驶规划与决策方法,覆盖序列决策在车辆场景的关键框架与挑战。
  3. Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot(中文笔记)— 提出价值函数引导的技能链式框架解决长时程稀疏奖励与子任务连接问题,有中文笔记且直接对应本Topic。
  1. 先读决策理论规划经典建立MDP与结构假设基础
  2. 再读自动驾驶规划决策综述理解应用场景
  3. 研读深度RL/IL策略学习 survey 掌握现代方法
  4. 深入价值引导技能链式与LLM自主智能体近期工作
  5. 比较不同输入输出表示与目标并总结工程风险
Paper 输入 输出 表示 训练目标
Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot 长时程手术机器人任务状态与子任务 链式策略与终止状态 全任务成功概率价值函数引导 实现平滑技能连接与高效策略学习
DTPP: Differentiable Joint Conditional Prediction and Cost Evaluation for Tree Policy Planning 场景与自车条件查询 树状策略规划 查询中心Transformer与可学习上下文感知代价 联合可微训练优化闭环规划性能
MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making 经验与长期记忆 规划与决策动作 多尺度洞察生成与任务相关选择 提升具身智能体规划对齐性与鲁棒性
A survey on large language model based autonomous agents 统一架构框架 系统梳理LLM自主智能体构建应用与评估
  • 长时程稀疏奖励导致探索效率低与训练不稳定
  • 子任务终端状态与下一技能起始集分布不匹配
  • 部分可观测性下策略对噪声与域偏移鲁棒性不足
  • 预测与代价分离训练忽视闭环联合优化效果
  • 从仿真到真实部署的技能链式转移失败
  • 如何自动发现可组合且可转移的技能库以支持更长时程任务
  • 价值引导与LLM多尺度洞察如何更好融合以兼顾可解释性与效率
  • 序列决策中闭环规划与世界模型预测的联合优化边界在哪里
  • 部分可观测与多智能体交互下策略学习的可扩展性如何提升
  1. MDP的核心组成部分与马尔可夫性假设是什么?
  2. 长时程任务中单片策略与技能分解策略的主要优劣对比?
  3. 价值函数在技能链式连接中如何指导终止状态选择?
  4. 自动驾驶序列决策中深度RL与IL方法的典型差异是什么?
  5. LLM驱动自主智能体在规划决策时面临的主要洞察噪声问题有哪些?

本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
recent Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot 2023 auto refresh 2026-07-19 sources=arxiv
watch MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making 2024 cross-topic assign from registry title match=2 keywords; 202
watch MazeEval: A Benchmark for Testing Sequential Decision-Making in Language Models 2025 auto score=50
watch From language to action: a review of large language models as autonomous agents and tool users 2025 auto score=52
recent Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation 2025 auto refresh 2026-07-19 sources=arxiv
recent Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents 2026 auto refresh 2026-07-19 sources=arxiv
recent A survey on large language model based autonomous agents 2024 auto refresh 2026-07-19 sources=openalex
watch Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving 2024 cross-topic assign from registry title match=2 keywords; 202
watch Learning to Track: Online Multi-object Tracking by Decision Making 2015 auto refresh 2026-07-19 sources=openalex
foundational A Survey of Deep RL and IL for Autonomous Driving Policy Learning 2021 RL/IL survey covers sequential decision policies for AD
recent Transfer Learning in Deep Reinforcement Learning: A Survey 2023 auto refresh 2026-07-19 sources=openalex
foundational Planning and Decision-Making for Autonomous Vehicles 2018 Annual Review Planning and Decision-Making for Autonomous Ve
watch Motion planning with sequential convex optimization and convex collision checking 2014 cross-topic assign from registry title match=2 keywords; 202
foundational Decision-Theoretic Planning: Structural Assumptions and Computational Leverage 1999 auto refresh 2026-07-19 sources=openalex
watch Neuro-Symbolic Decision Making for Autonomous Agents 2026 auto score=48
watch DTPP: Differentiable Joint Conditional Prediction and Cost Evaluation for Tree Policy Planning 2023 cross-topic assign from registry title match=2 keywords; 202

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 0 · 待获取 PDF 3)

Section titled “基础必读(选题 3 · 可学习 0 · 待获取 PDF 3)”

本档尚无可学习正文(PDF/中文笔记);下列为待获取选题。

  • A Survey of Deep RL and IL for Autonomous Driving Policy Learning (2021) · 待获取 PDF
  • Planning and Decision-Making for Autonomous Vehicles (2018) · 待获取 PDF
  • Decision-Theoretic Planning: Structural Assumptions and Computational Leverage (1999) · 待获取 PDF

近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)

Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”

观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)

Section titled “观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)”

成熟度 seed · 内容数 52 · 论文池 16