跳转到内容

模仿学习与强化学习的分工

类型 笔记 · 更新 2026-07-20

标签 reinforcement-learning · end-to-end-learning · planning

所属 模仿学习与离线学习 · 强化学习

IL(含 BC) 把专家轨迹当监督,收敛快但受协变量偏移与长 horizon 复合误差困扰;RL 直接优化任务回报,能超专家,却依赖仿真、奖励设计与安全约束。

  • 有大量高质量演示,开环指标可接受作第一阶段。
  • 需要可复现的强基线(驾驶、操作)。
  • 开环好、闭环差(交互、恢复、长 horizon)。
  • 可用仿真或离线日志做约束优化 / RLHF 式微调。
  • 把「BC loss 更低」当成「更会开」。
  • 忽略奖励 hacking 与 sim-to-real 差距。
  • Topic:imitation-offlinereinforcement-learning