序列决策学习
序列决策学习
Section titled “序列决策学习”在时间序列上做决策的学习范式,含强化学习与模仿/离线学习。
类型 Topics · 更新 2026-07-20
本 Topic 要解决什么
Section titled “本 Topic 要解决什么”本Topic聚焦序列决策学习,解决在马尔可夫决策过程框架下如何通过策略学习、价值估计与技能分解,使智能体在长时程、稀疏奖励、部分可观测环境中生成最优或近优动作序列。核心挑战包括时序依赖建模、探索效率、子任务连接脆弱性、预测-规划-代价联合优化,以及从经典决策理论到深度RL/IL再到LLM驱动自主智能体的范式迁移。应用于自动驾驶政策学习、手术机器人长时程操作、具身智能规划等,旨在提升闭环任务成功率、鲁棒性与泛化能力,弥合单步决策与长期交互的鸿沟。基于给定书目与片段构建,未知实验细节待核验。
非目标 / 边界
Section titled “非目标 / 边界”- 不深入单帧感知或检测分类模型细节
- 不覆盖纯硬件实时控制实现与部署优化
- 不讨论非序列的静态优化问题
foundations— 需掌握概率图模型、优化基础与控制理论以理解MDP与规划假设reinforcement-learning— 序列决策与RL紧密关联,需先熟悉基本MDP形式化与策略梯度/价值迭代概念
| 术语 | 含义 | 常见混淆 |
|---|---|---|
| MDP | 马尔可夫决策过程,由状态、动作、转移、奖励构成的序列决策形式化框架,满足马尔可夫性。 | 常与POMDP混淆,后者处理部分可观测状态 |
| 策略学习 | 从数据或交互中学习状态到动作映射(确定性或随机),以最大化期望累积回报。 | 易与单纯价值学习混淆,策略可直接或间接获得 |
| 价值函数 | 估计从某状态或状态-动作对出发的期望长期回报,用于指导决策与技能终止。 | V函数与Q函数用途不同,前者仅状态后者含动作 |
| 技能链式连接 | 将长时程任务分解为子任务策略并顺序连接,依赖终止状态选择以保证下一技能可行。 | 粗分解易导致状态分布不匹配,价值引导可缓解 |
| 长时程任务 | 多步骤、持续时长长、奖励稀疏的序列决策问题,单片策略探索负担重。 | 与短视单步决策相对,需层次化或记忆增强方法 |
| 决策理论规划 | 基于期望效用最大化的结构化规划,利用问题假设实现计算杠杆。 | 与纯启发式搜索区分,强调概率与效用结构 |
方法谱系与时间线
Section titled “方法谱系与时间线”早期依赖决策理论规划的结构假设与动态规划计算杠杆进行序列决策。随后转向深度强化学习与模仿学习的端到端策略学习,直接从数据优化自动驾驶等政策。近期进一步引入价值引导的技能链式连接处理长时程稀疏奖励,以及LLM驱动的多尺度洞察与统一架构自主智能体,融合世界模型与神经符号方法实现更开放的规划与决策。
- (1999) foundational — Decision-Theoretic Planning: Structural Assumptions and Computational Leverage
- (2014) watch — Motion planning with sequential convex optimization and convex collision checking
- (2015) watch — Learning to Track: Online Multi-object Tracking by Decision Making
- (2018) foundational — Planning and Decision-Making for Autonomous Vehicles
- (2021) foundational — A Survey of Deep RL and IL for Autonomous Driving Policy Learning
- (2023) recent — Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot
- (2023) recent — Transfer Learning in Deep Reinforcement Learning: A Survey
- (2023) watch — DTPP: Differentiable Joint Conditional Prediction and Cost Evaluation for Tree Policy Planning
- (2024) watch — MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making
- (2024) recent — A survey on large language model based autonomous agents
- (2024) watch — Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving
- (2025) watch — MazeEval: A Benchmark for Testing Sequential Decision-Making in Language Models
- (2025) watch — From language to action: a review of large language models as autonomous agents and tool users
- (2025) recent — Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation
- (2026) recent — Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents
- (2026) watch — Neuro-Symbolic Decision Making for Autonomous Agents
- Decision-Theoretic Planning: Structural Assumptions and Computational Leverage(仅书目)— 奠定序列决策理论规划的核心结构假设与计算优势,是理解MDP与决策理论基础的必读经典。
- Planning and Decision-Making for Autonomous Vehicles(精读)— 系统综述自动驾驶规划与决策方法,覆盖序列决策在车辆场景的关键框架与挑战。
- Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot(中文笔记)— 提出价值函数引导的技能链式框架解决长时程稀疏奖励与子任务连接问题,有中文笔记且直接对应本Topic。
推荐阅读路径
Section titled “推荐阅读路径”- 先读决策理论规划经典建立MDP与结构假设基础
- 再读自动驾驶规划决策综述理解应用场景
- 研读深度RL/IL策略学习 survey 掌握现代方法
- 深入价值引导技能链式与LLM自主智能体近期工作
- 比较不同输入输出表示与目标并总结工程风险
| Paper | 输入 | 输出 | 表示 | 训练目标 |
|---|---|---|---|---|
| Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot | 长时程手术机器人任务状态与子任务 | 链式策略与终止状态 | 全任务成功概率价值函数引导 | 实现平滑技能连接与高效策略学习 |
| DTPP: Differentiable Joint Conditional Prediction and Cost Evaluation for Tree Policy Planning | 场景与自车条件查询 | 树状策略规划 | 查询中心Transformer与可学习上下文感知代价 | 联合可微训练优化闭环规划性能 |
| MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making | 经验与长期记忆 | 规划与决策动作 | 多尺度洞察生成与任务相关选择 | 提升具身智能体规划对齐性与鲁棒性 |
| A survey on large language model based autonomous agents | — | — | 统一架构框架 | 系统梳理LLM自主智能体构建应用与评估 |
工程实现与复现风险
Section titled “工程实现与复现风险”- 长时程稀疏奖励导致探索效率低与训练不稳定
- 子任务终端状态与下一技能起始集分布不匹配
- 部分可观测性下策略对噪声与域偏移鲁棒性不足
- 预测与代价分离训练忽视闭环联合优化效果
- 从仿真到真实部署的技能链式转移失败
- 如何自动发现可组合且可转移的技能库以支持更长时程任务
- 价值引导与LLM多尺度洞察如何更好融合以兼顾可解释性与效率
- 序列决策中闭环规划与世界模型预测的联合优化边界在哪里
- 部分可观测与多智能体交互下策略学习的可扩展性如何提升
Topic 自测清单
Section titled “Topic 自测清单”- MDP的核心组成部分与马尔可夫性假设是什么?
- 长时程任务中单片策略与技能分解策略的主要优劣对比?
- 价值函数在技能链式连接中如何指导终止状态选择?
- 自动驾驶序列决策中深度RL与IL方法的典型差异是什么?
- LLM驱动自主智能体在规划决策时面临的主要洞察噪声问题有哪些?
选篇附录(registry)
Section titled “选篇附录(registry)”本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。
子 Topic
Section titled “子 Topic”论文池(FRW)
Section titled “论文池(FRW)”来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5。
可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。
基础必读(选题 3 · 可学习 0 · 待获取 PDF 3)
Section titled “基础必读(选题 3 · 可学习 0 · 待获取 PDF 3)”本档尚无可学习正文(PDF/中文笔记);下列为待获取选题。
- A Survey of Deep RL and IL for Autonomous Driving Policy Learning (2021) · 待获取 PDF
- Planning and Decision-Making for Autonomous Vehicles (2018) · 待获取 PDF
- Decision-Theoretic Planning: Structural Assumptions and Computational Leverage (1999) · 待获取 PDF
近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)
Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”- Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation (2025) · 中文笔记
- A survey on large language model based autonomous agents (2024) · 中文笔记
- Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents (2026) · 中文笔记
- Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot (2023) · 中文笔记
- Transfer Learning in Deep Reinforcement Learning: A Survey (2023) · 待获取 PDF
观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)
Section titled “观察清单(选题 8 · 可学习 7 · 待获取 PDF 1)”- MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making (2024) · 中文笔记
- Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving (2024) · 中文笔记
- Motion planning with sequential convex optimization and convex collision checking (2014) · 精读
- DTPP: Differentiable Joint Conditional Prediction and Cost Evaluation for Tree Policy Planning (2023) · 中文笔记
- From language to action: a review of large language models as autonomous agents and tool users (2025) · 中文笔记
- MazeEval: A Benchmark for Testing Sequential Decision-Making in Language Models (2025) · 中文笔记
- Neuro-Symbolic Decision Making for Autonomous Agents (2026) · 中文笔记
- Learning to Track: Online Multi-object Tracking by Decision Making (2015) · 待获取 PDF
聚合内容(子树)
Section titled “聚合内容(子树)”成熟度 seed · 内容数 52 · 论文池 16