跳转到内容

决策视野与复合误差

类型 笔记 · 更新 2026-07-20

标签 end-to-end-learning · planning · closed-loop-evaluation

所属 模仿学习与离线学习 · 预测、规划与控制

单步监督误差在多步展开时会复合:状态离开训练分布后,策略继续犯错。视野越长,开环 log-likelihood 与闭环表现越容易脱节。

  1. 缩短开环依赖:高频重规划、短 horizon 动作块。
  2. 纠正分布:DAgger、交互数据、闭环微调。
  3. 结构化输出:轨迹/路径参数化优于原始控制序列硬回归。
  4. 世界模型 / 想象 rollout:用模型评估多步代价,而非只拟合下一步。

必须同时报开环(ADE/FDE、L2)与闭环(碰撞、进度、舒适性);只报其一会系统性误导。