跳转到内容

学习路线

具身智能算法专家成长笔记 — 主路径(约 10 站 spine)优先于全量 Topic 目录;自动驾驶是当前应用路线,不是唯一身份。

能力链全景:基础理论 → 感知 → 世界模型 → 决策规划 → VLA/Agent → 系统部署 → 自动驾驶应用。

当前公开统计:Topic 38 · 文献 388 · 精读 23 · 中文笔记 236 · 自动卡 129 · 仅元数据 0。

正式选题池中 可学习基础必读 0 / 选题 114 · 待获取 PDF 304(不链入下方必读)。

学习进度保存在浏览器 localStorage(无账号)。勾选文献/Topic 页「已读」后,本页会汇总完成度。

每个阶段列出 Topic 与可学必读(有 PDF 或精读/中文笔记);无正文资产的 foundational 选题标为待获取 PDF,不会链到空自动卡。

先选一条分轨进入主路径;分轨可重叠,完成后用下方「完整能力地图」补选修。

多视角 3D 检测、BEV/稀疏表示与跟踪记忆,面向感知栈算法岗。

Query-based 检测与集合预测3D 与空间感知自动驾驶 3D 感知、时序融合与跟踪多模态感知与融合时序感知、跟踪与记忆

预测—规划—控制、模仿/强化学习与闭环评测,面向决策规划算法岗。

轨迹优化与模型预测控制模仿学习与离线学习强化学习预测、规划与控制自动驾驶预测、规划与控制端到端驾驶

世界模型、VLA 与具身基础模型,面向通用具身策略研究。

世界模型VLA 模型具身基础模型与智能体具身智能体机器人操作

10 站,建议按序完成;每站以精读/中文笔记必读为准,不以空自动卡凑数。

DETR 系集合预测、object query 与 deformable attention——多视角 3D 感知与 BEV 检测的方法前置,而非泛化数学基础。

必读

在动力学与避障约束下将规划写成可求解优化:轨迹优化、最优控制、MPC 与序列凸化——服务 motion planning,不是概率/线代通识课。

必读

多视角 3D 检测、BEV 感知、时序融合与多目标跟踪方法(含 Sparse4D 系列)。

必读

多视角 3D 检测、BEV 表征与几何感知方法。

必读

行为预测、任务/运动规划与控制执行的能力。

必读

从专家数据学习策略的模仿学习与离线强化学习方法。

必读

基于环境交互、回报和价值估计学习决策策略的知识入口。

必读

学习环境动力学以预测、想象与规划的世界模型方法。

必读

视觉-语言-动作模型,端到端映射感知与指令到动作。

必读

端到端感知-预测-规划一体化驾驶模型(UniAD、VAD、SparseDrive、DiffusionDrive、RAD、Senna 等)。

必读

以下为全量 Topic 雷达;不要求全部读完。主路径之外的条目作深潜选修。

  • Query-based 检测与集合预测 · 主路径 — DETR 系集合预测、object query 与 deformable attention——多视角 3D 感知与 BEV 检测的方法前置,而非泛化数学基础。
  • 轨迹优化与模型预测控制 · 主路径 — 在动力学与避障约束下将规划写成可求解优化:轨迹优化、最优控制、MPC 与序列凸化——服务 motion planning,不是概率/线代通识课。
  • 表征学习与生成建模 — 学习通用表征与生成模型的方法,含扩散、自监督与多模态预训练。
  • 扩散模型 — 扩散生成模型及其在表示、预测和策略生成中的学习入口。
  • VLA 模型 · 主路径 — 视觉-语言-动作模型,端到端映射感知与指令到动作。
  • 具身智能体 — 具备记忆、规划与交互的长时具身智能体。
  • 具身基础模型与智能体 — LLM、VLM、VLA 与具身智能体等驱动决策与交互的基础模型。
  • 具身智能能力栈 — 感知、世界建模、预测规划控制与具身基础模型组成的端到端能力链。
  • LLM 与语言推理 — 大语言模型驱动的推理、任务分解与指令理解。
  • 端到端学习 — 从低层输入到最终任务目标进行联合优化的方法与系统问题。
  1. 主路径第一站 — Query-based 检测与集合预测
  2. 分轨:感知算法VLA · 具身
  3. 自动驾驶应用路线 — 当前应用深潜
  4. 浏览全部 Topic · 论文库 · 概念笔记