模仿学习与强化学习的分工
模仿学习与强化学习的分工
Section titled “模仿学习与强化学习的分工”类型 笔记 · 更新 2026-07-20
IL(含 BC) 把专家轨迹当监督,收敛快但受协变量偏移与长 horizon 复合误差困扰;RL 直接优化任务回报,能超专家,却依赖仿真、奖励设计与安全约束。
何时优先 IL
Section titled “何时优先 IL”- 有大量高质量演示,开环指标可接受作第一阶段。
- 需要可复现的强基线(驾驶、操作)。
何时引入 RL / 混合
Section titled “何时引入 RL / 混合”- 开环好、闭环差(交互、恢复、长 horizon)。
- 可用仿真或离线日志做约束优化 / RLHF 式微调。
- 把「BC loss 更低」当成「更会开」。
- 忽略奖励 hacking 与 sim-to-real 差距。
- Topic:
imitation-offline、reinforcement-learning