学习路线
具身智能算法专家成长笔记 — 主路径(约 10 站 spine)优先于全量 Topic 目录;自动驾驶是当前应用路线,不是唯一身份。
能力链全景:基础理论 → 感知 → 世界模型 → 决策规划 → VLA/Agent → 系统部署 → 自动驾驶应用。
当前公开统计:Topic 38 · 文献 388 · 精读 23 · 中文笔记 236 · 自动卡 129 · 仅元数据 0。
正式选题池中 可学习基础必读 0 / 选题 114 · 待获取 PDF 304(不链入下方必读)。
学习进度保存在浏览器 localStorage(无账号)。勾选文献/Topic 页「已读」后,本页会汇总完成度。
每个阶段列出 Topic 与可学必读(有 PDF 或精读/中文笔记);无正文资产的 foundational 选题标为待获取 PDF,不会链到空自动卡。
先选一条分轨进入主路径;分轨可重叠,完成后用下方「完整能力地图」补选修。
分轨:感知算法
Section titled “分轨:感知算法”多视角 3D 检测、BEV/稀疏表示与跟踪记忆,面向感知栈算法岗。
Query-based 检测与集合预测 → 3D 与空间感知 → 自动驾驶 3D 感知、时序融合与跟踪 → 多模态感知与融合 → 时序感知、跟踪与记忆
分轨:决策控制
Section titled “分轨:决策控制”预测—规划—控制、模仿/强化学习与闭环评测,面向决策规划算法岗。
轨迹优化与模型预测控制 → 模仿学习与离线学习 → 强化学习 → 预测、规划与控制 → 自动驾驶预测、规划与控制 → 端到端驾驶
分轨:VLA · 具身
Section titled “分轨:VLA · 具身”世界模型、VLA 与具身基础模型,面向通用具身策略研究。
世界模型 → VLA 模型 → 具身基础模型与智能体 → 具身智能体 → 机器人操作
主路径(spine)
Section titled “主路径(spine)”共 10 站,建议按序完成;每站以精读/中文笔记必读为准,不以空自动卡凑数。
DETR 系集合预测、object query 与 deformable attention——多视角 3D 感知与 BEV 检测的方法前置,而非泛化数学基础。
必读
- End-to-End Object Detection with Transformers — 精读 · DETR奠基作,首次用Transformer编码器-解码器+二分图匹配将检测变为端到端集合预测,去除锚框与NMS,展示简洁性与可扩展性
- Deformable DETR: Deformable Transformers for End-to-End Object Detection — 精读 · 引入deformable attention解决DETR收敛慢与小物体弱问题,成为BEV检测等后续工作的注意力基础
- End-to-End Object Detection with Adaptive Clustering Transformer · 中文笔记
在动力学与避障约束下将规划写成可求解优化:轨迹优化、最优控制、MPC 与序列凸化——服务 motion planning,不是概率/线代通识课。
必读
- 本 Topic 基础必读选题 3 篇中有 3 篇待获取 PDF;下列为已精读/中文笔记替补。
- Motion planning with sequential convex optimization and convex collision checking — 精读 · 序列凸优化 + 凸碰撞检查的运动规划经典路径,直接服务轨迹优化与避障约束
- Trajectory optimization of connected and autonomous vehicles at a multilane freeway merging area — 精读 · 多车道合流区轨迹优化案例,把优化目标落到交通场景
- A real-time motion planner with trajectory optimization for autonomous vehicles · 中文笔记
多视角 3D 检测、BEV 感知、时序融合与多目标跟踪方法(含 Sparse4D 系列)。
必读
- DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D Queries — 精读 · 奠基稀疏query多视图3D检测范式,引入3D参考点投影采样,是PET/Sparse系列源头
- BEVFormer: Learning Bird’s-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers — 精读 · 建立时空BEV Transformer主线,支持时序融合与高效多相机BEV构建,高采用率
- BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View — 中文笔记 · 模块化BEV检测范式,视图解耦增强与Scale-NMS,提供精度-效率权衡与多任务统一思路,有中文笔记
多视角 3D 检测、BEV 表征与几何感知方法。
必读
- BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View — 精读 · 奠定多相机 BEV 检测模块化范式,视图解耦增强与 Scale-NMS 提升效率精度权衡,统一检测与语义分割路径
- BEVFormer: Learning Bird’s-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers — 精读 · 核心时空 Transformer 方法,通过 deformable attention 高效学习 BEV 表征,支撑多相机空间感知
- SurroundDepth: Entangling Surrounding Views for Self-Supervised Multi-Camera Depth Estimation — 中文笔记 · 环视多相机自监督深度基础,纠缠周围视图提升一致性,覆盖 depth estimation 关键关键词
行为预测、任务/运动规划与控制执行的能力。
必读
- DTPP: Differentiable Joint Conditional Prediction and Cost Evaluation for Tree Policy Planning — 精读 · 可微分联合条件预测与可学习代价的树策略规划框架,直接优化闭环,有中文笔记与代码参考价值
- PPAD: Iterative Interactions of Prediction and Planning for End-to-end Autonomous Driving — 中文笔记 · 时间步级迭代预测-规划交互机制,层次化注意力建模 ego-agent 博弈,有中文笔记
- MTR: Motion Transformer with Global Intention Localization and Local Movement Refinement · 中文笔记
从专家数据学习策略的模仿学习与离线强化学习方法。
必读
- 本 Topic 基础必读选题 3 篇中有 3 篇待获取 PDF;下列为已精读/中文笔记替补。
- Exploring the Limitations of Behavior Cloning for Autonomous Driving — 精读 · 系统剖析 BC 在驾驶中的协变量偏移、闭环退化与数据覆盖边界
- Is Behavior Cloning All You Need? Understanding Horizon in Imitation Learning — 精读 · 从 horizon / compounding error 理解模仿学习何时够用、何时必须引入交互或离线 RL
- DecompGAIL: Learning Realistic Traffic Behaviors with Decomposed Multi-Agent Generative Adversarial Imitation Learning · 中文笔记
基于环境交互、回报和价值估计学习决策策略的知识入口。
必读
- DRL-Based Trajectory Tracking for Motion-Related Modules in Autonomous Driving — 精读 · 运动相关模块上的 DRL 轨迹跟踪,连接 RL 与规划控制接口
- Reinforced Imitative Trajectory Planning for Urban Automated Driving — 精读 · 强化模仿式轨迹规划,示范 RL+IL 混合在城市场景规划中的用法
- RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS and Reinforcement Learning — 待获取 PDF / 自动卡 · 大规模 3DGS 闭环 RL 案例;精读笔记齐备前作扩展书目,不作空链必读
学习环境动力学以预测、想象与规划的世界模型方法。
必读
- OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving — 精读 · 直接构建驾驶场景3D占用世界模型,体现潜在动态与未来预报核心范式
- The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey — 精读 · 系统梳理世界模型在自动驾驶中的角色、分类与挑战,提供全景与路线
- Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving — 精读 · 多视图视觉预报与规划结合世界模型的代表工作,连接感知到决策
视觉-语言-动作模型,端到端映射感知与指令到动作。
必读
- 本 Topic 基础必读选题 3 篇中有 2 篇待获取 PDF;下列为已精读/中文笔记替补。
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control — 中文笔记 · 奠定VLA核心范式:动作token化+VLM联合微调,展示知识迁移、新颖泛化与涌现语义推理,是从规划到低层控制的关键奠基工作
- OpenVLA: An Open-Source Vision-Language-Action Model — 中文笔记 · 提供全开源(数据/权重/代码)7B通用操作策略基线,支持多机器人开箱与参数高效微调,填补闭源空白并成为标准开放对照
- Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review · 中文笔记
端到端感知-预测-规划一体化驾驶模型(UniAD、VAD、SparseDrive、DiffusionDrive、RAD、Senna 等)。
必读
- DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving — 精读 · 主线近期工作,展示截断扩散在E2E规划中的高效多模态轨迹生成
- CogAD: Cognitive-Hierarchy Guided End-to-End Autonomous Driving — 中文笔记 · 引入认知层次解决感知-规划与人类错位问题,有中文笔记辅助理解
- UniAD: Planning-oriented Autonomous Driving · 中文笔记
完整能力地图(选修)
Section titled “完整能力地图(选修)”以下为全量 Topic 雷达;不要求全部读完。主路径之外的条目作深潜选修。
- Query-based 检测与集合预测 · 主路径 — DETR 系集合预测、object query 与 deformable attention——多视角 3D 感知与 BEV 检测的方法前置,而非泛化数学基础。
- 轨迹优化与模型预测控制 · 主路径 — 在动力学与避障约束下将规划写成可求解优化:轨迹优化、最优控制、MPC 与序列凸化——服务 motion planning,不是概率/线代通识课。
- 表征学习与生成建模 — 学习通用表征与生成模型的方法,含扩散、自监督与多模态预训练。
- 扩散模型 — 扩散生成模型及其在表示、预测和策略生成中的学习入口。
- 3D 与空间感知 · 主路径 — 多视角 3D 检测、BEV 表征与几何感知方法。
- 时序感知、跟踪与记忆 — 跨帧融合、多目标跟踪与时序状态记忆。
- 多模态感知与融合 — 融合视觉、语言、点云与时序信号的多模态感知能力。
- VLM 与视觉语言理解 — 视觉语言模型对场景、物体与关系的理解。
- 世界模型 · 主路径 — 学习环境动力学以预测、想象与规划的世界模型方法。
- 世界建模与空间智能 — 对环境动力学与场景几何的建模,支撑预测、想象与规划。
- 场景表示与长期记忆 — 场景级几何、语义与占据表示及长期记忆。
- 仿真与合成数据 — 仿真引擎、场景生成与合成数据的方法与工具。
- 序列决策学习 — 在时间序列上做决策的学习范式,含强化学习与模仿/离线学习。
- 强化学习 · 主路径 — 基于环境交互、回报和价值估计学习决策策略的知识入口。
- 模仿学习与离线学习 · 主路径 — 从专家数据学习策略的模仿学习与离线强化学习方法。
- 行为与运动预测 — 对他车/行人/智能体未来轨迹与行为的预测。
- 运动规划与控制 — 运动规划、轨迹优化与底盘/机械臂控制执行。
- 决策与任务规划 — 高层行为决策、任务规划与行为树/有限状态策略。
- 预测、规划与控制 · 主路径 — 行为预测、任务/运动规划与控制执行的能力。
VLA / Agent
Section titled “VLA / Agent”- VLA 模型 · 主路径 — 视觉-语言-动作模型,端到端映射感知与指令到动作。
- 具身智能体 — 具备记忆、规划与交互的长时具身智能体。
- 具身基础模型与智能体 — LLM、VLM、VLA 与具身智能体等驱动决策与交互的基础模型。
- 具身智能能力栈 — 感知、世界建模、预测规划控制与具身基础模型组成的端到端能力链。
- LLM 与语言推理 — 大语言模型驱动的推理、任务分解与指令理解。
- 端到端学习 — 从低层输入到最终任务目标进行联合优化的方法与系统问题。
- 系统工程与评测 — 数据、仿真、训练、评测与部署的工程能力主干,独立于具体方法。
- 训练系统与实验管理 — 大规模训练基础设施、分布式训练与实验追踪。
- 模型部署与推理优化 — 量化、蒸馏、推理引擎与端侧/车载部署优化。
- 数据工程与数据闭环 — 数据采集、标注、清洗与闭环反馈的工程能力。
- 基准、评测与安全 — 评测基准、闭环评测、行为指标与安全验证。
自动驾驶应用
Section titled “自动驾驶应用”- 自动驾驶 — 自动驾驶感知、跟踪、预测、规划与系统评测的知识地图。
- 自动驾驶 3D 感知、时序融合与跟踪 · 主路径 — 多视角 3D 检测、BEV 感知、时序融合与多目标跟踪方法(含 Sparse4D 系列)。
- 自动驾驶预测、规划与控制 — 自动驾驶中的轨迹预测、规划与控制方法(MTR、DTPP、PLUTO 等)。
- 端到端驾驶 · 主路径 — 端到端感知-预测-规划一体化驾驶模型(UniAD、VAD、SparseDrive、DiffusionDrive、RAD、Senna 等)。
- 自动驾驶数据集、基准与评测 — nuScenes、Waymo 等数据集与开环/闭环评测基准。
- 应用领域与案例 — 按应用场景组织的方法与案例:自动驾驶、移动机器人导航与机器人操作。
- 移动机器人与导航 — 移动机器人的建图、定位、路径规划与导航方法。
- 机器人操作 — 机械臂抓取、操作与接触丰富控制的策略与表征。