具身智能算法专家成长笔记
Section titled “具身智能算法专家成长笔记”面向具身智能算法成长:问题形式化 · 方法谱系 · 精读判断 · 复现闭环。自动驾驶是当前应用路线之一。
职业分轨:感知算法 · 决策控制 · VLA · 具身
当前真实统计
Section titled “当前真实统计”| 指标 | 数量 |
|---|---|
| Topics | 38 |
| 文献卡片 | 388 |
| 人工精读 reviewed | 23 |
| 中文学习笔记 | 236 |
| 英文自动卡 | 129 |
| 仅元数据 | 0 |
| 正式论文池 | 380 |
| 基础必读选题(可学习) | 114(0) |
| 近期 / 观察选题 | 190 / 283 |
| 待获取 PDF(基础+近期) | 304 |
| 发现候选(全 Topic) | 4954 |
| 含 Asta 证据的 Topic | 31 |
| 今日刷新候选 Topic | 0 |
| 公开文档合计 | 445 |
具身智能能力地图
Section titled “具身智能能力地图”应用领域与案例按应用场景组织的方法与案例:自动驾驶、移动机器人导航与机器人操作。 · Topics · 2026-07-19
具身智能能力栈感知、世界建模、预测规划控制与具身基础模型组成的端到端能力链。 · Topics · 2026-07-19
Query-based 检测与集合预测DETR 系集合预测、object query 与 deformable attention——多视角 3D 感知与 BEV 检测的方法前置,而非泛化数学基础。 · Topics · 2026-07-20
系统工程与评测数据、仿真、训练、评测与部署的工程能力主干,独立于具体方法。 · Topics · 2026-07-20
Sparse4D v1 文献笔记如何在多相机 3D 检测中,以少量目标相关的 3D anchors 替代 dense BEV 网格,并融合跨帧观测。 · 文献 · 精读 · 2026-07-11
Sparse4D v2 文献笔记如何将前一帧的高置信目标状态直接作为下一帧 decoder 的输入,以稳定地利用时序信息。 · 文献 · 精读 · 2026-07-11
Sparse4D v3 文献笔记如何在 v2 的 recurrent instance memory 上提升检测质量并输出稳定的跨帧目标 ID。 · 文献 · 精读 · 2026-07-11
SparseDrive 文献笔记如何将 Sparse4D 风格的稀疏场景表示从检测与跟踪扩展到端到端自动驾驶规划。 · 文献 · 精读 · 2026-07-11
nuScenes: A Multimodal Dataset for Autonomous DrivingnuScenes是首个全传感器套件、含雷达与属性标注的大规模多模态自动驾驶数据集(1000个20s场景),并定义了基于中心距离的3D检测/跟踪指标与基线。 · 文献 · 精读 · 2026-07-14
End-to-End Object Detection with TransformersDETR通过Transformer编码器-解码器与二分图匹配集合损失,将目标检测变为直接并行输出固定大小物体集合的端到端问题,在COCO上达到与优化后Faster R-CNN相当的性能。 · 文献 · 精读 · 2026-07-20
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic ControlRT-2 通过将机器人动作 token 化并与网络规模 VQA 等任务共同微调 VLM,直接输出低层控制动作,从而把网页知识迁移到机器人闭环控制并获得涌现能力。 · 文献 · 精读 · 2026-07-20
OpenVLA: An Open-Source Vision-Language-Action ModelOpenVLA是基于Llama 2与融合DINOv2+SigLIP视觉编码器的7B开源VLA,在970k Open X-Embodiment轨迹上训练,实现通用多机器人操作与高效微调,优于更大闭源模型。 · 文献 · 精读 · 2026-07-20
当前应用路线:自动驾驶
Section titled “当前应用路线:自动驾驶”BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal TransformersBEVFormer通过预定义网格BEV查询与时空注意力,从多相机图像与历史BEV中自适应聚合信息,生成支持多感知任务的统一BEV特征。 · 文献 · 精读 · 2026-07-20
PETR: Position Embedding Transformation for Multi-View 3D Object DetectionPETR通过3D位置嵌入变换将多视角2D特征转化为3D位置感知特征,实现简单端到端的多视角3D目标检测并取得SOTA。 · 文献 · 精读 · 2026-07-20
VAD: Vectorized Scene Representation for Efficient Autonomous DrivingVAD 将驾驶场景建模为全向量化表示(智能体运动向量与地图向量),通过查询交互与实例级规划约束实现高效、安全的端到端轨迹规划。 · 文献 · 精读 · 2026-07-20
nuScenes: A Multimodal Dataset for Autonomous DrivingnuScenes是首个全传感器套件、含雷达与属性标注的大规模多模态自动驾驶数据集(1000个20s场景),并定义了基于中心距离的3D检测/跟踪指标与基线。 · 文献 · 精读 · 2026-07-14
Sparse4D v1 文献笔记如何在多相机 3D 检测中,以少量目标相关的 3D anchors 替代 dense BEV 网格,并融合跨帧观测。 · 文献 · 精读 · 2026-07-11
Sparse4D v2 文献笔记如何将前一帧的高置信目标状态直接作为下一帧 decoder 的输入,以稳定地利用时序信息。 · 文献 · 精读 · 2026-07-11
控制动作的 Token 化把连续控制离散成 token,使 VLA/语言模型头能统一视觉-语言-动作建模。 · 笔记 · 2026-07-20
BEV 稠密表征与稀疏实例表征鸟瞰稠密网格与稀疏 instance/query 在覆盖、算力、时序与下游规划接口上的取舍。 · 笔记 · 2026-07-20
闭环评测与开环指标开环拟合专家轨迹不等于可部署驾驶;闭环仿真/路测才暴露交互与恢复能力。 · 笔记 · 2026-07-20
决策视野与复合误差开环多步预测误差如何在闭环中放大,以及缩短依赖、重规划与世界模型的应对。 · 笔记 · 2026-07-20
模仿学习与强化学习的分工行为克隆适合分布内演示;RL/离线 RL 适合闭环目标与长视野,但样本与安全约束更苛刻。 · 笔记 · 2026-07-20
Query-based 检测范式用可学习 query 从多视角/BEV 特征中拉取实例,统一 2D DETR 到 3D 多相机检测的接口。 · 笔记 · 2026-07-20
最近可读文献
Section titled “最近可读文献”AdaWorld: Learning Adaptable World Models with Latent ActionsAdaWorld通过信息瓶颈自监督提取上下文不变的潜在动作,并以此条件预训练自回归世界模型,实现无需训练的动作迁移与高效适应。 · 文献 · 精读 · 2026-07-20
BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal TransformersBEVFormer通过预定义网格BEV查询与时空注意力,从多相机图像与历史BEV中自适应聚合信息,生成支持多感知任务的统一BEV特征。 · 文献 · 精读 · 2026-07-20
DRL-Based Trajectory Tracking for Motion-Related Modules in Autonomous Driving用DRL(结合域随机化与后优化)实现更鲁棒、精确的轨迹跟踪,在高初始速度下显著优于启发式方法。 · 文献 · 精读 · 2026-07-20
DeepFusion: Lidar-Camera Deep Fusion for Multi-Modal 3D Object DetectionDeepFusion在深度特征层融合激光雷达与相机,并用InverseAug与LearnableAlign解决增强导致的对齐难题,从而提升多模态3D目标检测精度与鲁棒性。 · 文献 · 精读 · 2026-07-20
Deformable DETR: Deformable Transformers for End-to-End Object DetectionDeformable DETR用只关注参考点周围少量采样点的可变形(多尺度)注意力替换标准Transformer注意力,使DETR在COCO上以约10倍更少训练epochs取得更好性能(尤其小目标)。 · 文献 · 精读 · 2026-07-20
End-to-End Object Detection with TransformersDETR通过Transformer编码器-解码器与二分图匹配集合损失,将目标检测变为直接并行输出固定大小物体集合的端到端问题,在COCO上达到与优化后Faster R-CNN相当的性能。 · 文献 · 精读 · 2026-07-20
最近自动入库
Section titled “最近自动入库”展开最近英文自动卡(默认收起,不抢主阅读流)
以下为英文自动卡,可与中文笔记对照阅读。
3D Gaussian Splatting as a New Era: A Survey[自动卡] Metadata-only card for 3D Gaussian Splatting as a New Era: A Survey. · 文献 · 自动卡 · 2026-07-19
A Motion Planning and Tracking Framework for Autonomous Vehicles Based on Artificial Potential Field Elaborated Resistance Network Approach[自动卡] Metadata-only card for A Motion Planning and Tracking Framework for Autonomous Vehicles Based on Artificial Potential Field Elaborated Resistance Network Appro… · 文献 · 自动卡 · 2026-07-19
A Review of Machine Learning and Deep Learning for Object Detection, Semantic Segmentation, and Human Action Recognition in Machine and Robotic Vision[自动卡] Metadata-only card for A Review of Machine Learning and Deep Learning for Object Detection, Semantic Segmentation, and Human Action Recognition in Machine and… · 文献 · 自动卡 · 2026-07-19