决策视野与复合误差
决策视野与复合误差
Section titled “决策视野与复合误差”类型 笔记 · 更新 2026-07-20
单步监督误差在多步展开时会复合:状态离开训练分布后,策略继续犯错。视野越长,开环 log-likelihood 与闭环表现越容易脱节。
- 缩短开环依赖:高频重规划、短 horizon 动作块。
- 纠正分布:DAgger、交互数据、闭环微调。
- 结构化输出:轨迹/路径参数化优于原始控制序列硬回归。
- 世界模型 / 想象 rollout:用模型评估多步代价,而非只拟合下一步。
必须同时报开环(ADE/FDE、L2)与闭环(碰撞、进度、舒适性);只报其一会系统性误导。