Tags
3d-detection
Section titled “3d-detection”BEV 稠密表征与稀疏实例表征鸟瞰稠密网格与稀疏 instance/query 在覆盖、算力、时序与下游规划接口上的取舍。 · 笔记 · 2026-07-20
BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal TransformersBEVFormer通过预定义网格BEV查询与时空注意力,从多相机图像与历史BEV中自适应聚合信息,生成支持多感知任务的统一BEV特征。 · 文献 · 精读 · 2026-07-20
CMT: Cross Modal Transformer Towards Fast and Robust 3D Object DetectionCMT用坐标编码模块将3D位置隐式注入图像与点云token,位置引导查询直接与多模态特征交互,实现快速鲁棒端到端3D检测,nuScenes测试集单模型74.1% NDS。 · 文献 · 中文笔记 · 2026-07-19
DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D QueriesDETR3D用稀疏3D物体查询经相机矩阵投影到多视角2D特征,实现无深度估计、无NMS的set-to-set 3D检测。 · 文献 · 中文笔记 · 2026-07-19
Exploring Object-Centric Temporal Modeling for Efficient Multi-View 3D Object DetectionStreamPETR以对象查询帧间传播长期历史信息并结合运动感知层归一化,实现高效在线多视角3D目标检测。 · 文献 · 中文笔记 · 2026-07-19
PETR: Position Embedding Transformation for Multi-View 3D Object DetectionPETR通过3D位置嵌入变换将多视角2D特征转化为3D位置感知特征,实现简单端到端的多视角3D目标检测并取得SOTA。 · 文献 · 精读 · 2026-07-20
PETRv2: A Unified Framework for 3D Perception from Multi-Camera ImagesPETRv2通过扩展3D位置嵌入做时序建模并用任务特定查询支持多任务学习,在多相机3D感知上达到SOTA表现。 · 文献 · 中文笔记 · 2026-07-19
Query-based 检测范式用可学习 query 从多视角/BEV 特征中拉取实例,统一 2D DETR 到 3D 多相机检测的接口。 · 笔记 · 2026-07-20
Sparse4D v1 文献笔记如何在多相机 3D 检测中,以少量目标相关的 3D anchors 替代 dense BEV 网格,并融合跨帧观测。 · 文献 · 精读 · 2026-07-11
Sparse4D v2 文献笔记如何将前一帧的高置信目标状态直接作为下一帧 decoder 的输入,以稳定地利用时序信息。 · 文献 · 精读 · 2026-07-11
稀疏时空采样稀疏查询如何在多视角与时间维度选择性聚合特征。 · 笔记 · 2026-07-11
集合预测与二分图匹配端到端检测如何用固定基数集合与 Hungarian 匹配替代 NMS 与启发式正负样本分配。 · 笔记 · 2026-07-20
autonomous-driving
Section titled “autonomous-driving”BEV 稠密表征与稀疏实例表征鸟瞰稠密网格与稀疏 instance/query 在覆盖、算力、时序与下游规划接口上的取舍。 · 笔记 · 2026-07-20
BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal TransformersBEVFormer通过预定义网格BEV查询与时空注意力,从多相机图像与历史BEV中自适应聚合信息,生成支持多感知任务的统一BEV特征。 · 文献 · 精读 · 2026-07-20
CMT: Cross Modal Transformer Towards Fast and Robust 3D Object DetectionCMT用坐标编码模块将3D位置隐式注入图像与点云token,位置引导查询直接与多模态特征交互,实现快速鲁棒端到端3D检测,nuScenes测试集单模型74.1% NDS。 · 文献 · 中文笔记 · 2026-07-19
DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D QueriesDETR3D用稀疏3D物体查询经相机矩阵投影到多视角2D特征,实现无深度估计、无NMS的set-to-set 3D检测。 · 文献 · 中文笔记 · 2026-07-19
DTPP: Differentiable Joint Conditional Prediction and Cost Evaluation for Tree Policy PlanningDTPP通过查询中心Transformer高效生成ego-conditioned场景树,并与可学习上下文感知代价联合可微训练,提升树状策略规划质量与效率。 · 文献 · 中文笔记 · 2026-07-19
DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving提出截断扩散策略(锚定高斯+截断日程)与级联扩散解码器,使DiffusionDrive仅需2步去噪即可生成多样高质量驾驶轨迹,在NAVSIM达88.1 PDMS并以45 FPS实时运行。 · 文献 · 中文笔记 · 2026-07-19
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous DrivingDiffusionDriveV2用强化学习约束截断扩散的GMM多模态轨迹生成,兼顾多样性与高质量,在NAVSIM v1/v2上以ResNet-34达到91.2 PDMS / 85.5 EPDMS新纪录。 · 文献 · 中文笔记 · 2026-07-19
Exploring Object-Centric Temporal Modeling for Efficient Multi-View 3D Object DetectionStreamPETR以对象查询帧间传播长期历史信息并结合运动感知层归一化,实现高效在线多视角3D目标检测。 · 文献 · 中文笔记 · 2026-07-19
GTRS: Generalized Trajectory Scoring for End-to-end Multimodal PlanningGTRS通过扩散轨迹生成、超密词汇dropout泛化与传感器增强+细化,实现端到端多模态规划中对静态/动态轨迹的鲁棒联合评分。 · 文献 · 中文笔记 · 2026-07-19
MTR: Motion Transformer with Global Intention Localization and Local Movement RefinementMTR采用静态意图查询与动态搜索查询构成的运动查询对,联合优化全局意图定位和局部轨迹精炼,实现高效准确的多模态运动预测。 · 文献 · 中文笔记 · 2026-07-19
PETR: Position Embedding Transformation for Multi-View 3D Object DetectionPETR通过3D位置嵌入变换将多视角2D特征转化为3D位置感知特征,实现简单端到端的多视角3D目标检测并取得SOTA。 · 文献 · 精读 · 2026-07-20
PETRv2: A Unified Framework for 3D Perception from Multi-Camera ImagesPETRv2通过扩展3D位置嵌入做时序建模并用任务特定查询支持多任务学习,在多相机3D感知上达到SOTA表现。 · 文献 · 中文笔记 · 2026-07-19
PLUTO: Pushing the Limit of Imitation Learning-based Planning for Autonomous DrivingPLUTO通过横向-纵向感知查询架构、可微插值辅助损失与对比模仿学习(CIL)框架,将基于模仿学习的自动驾驶规划推向极限,在nuPlan上取得SOTA闭环性能并首次超越顶级规则规划器。 · 文献 · 中文笔记 · 2026-07-19
RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework for End-to-End DrivingRAD-2通过扩散生成器+RL判别器解耦、TC-GRPO时序一致优化与OGO纵向on-policy更新,结合BEV-Warp高吞吐特征级闭环仿真,将高维轨迹RL优化稳定化并显著降低碰撞率。 · 文献 · 中文笔记 · 2026-07-19
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS and Reinforcement LearningRAD通过大规模3DGS构建逼真数字孪生环境进行闭环RL训练端到端驾驶策略,并以IL正则化实现人-车对齐,显著降低闭环碰撞率。 · 文献 · 中文笔记 · 2026-07-19
SSR: Navigation-guided Sparse Scene Representation for End-to-End Autonomous DrivingSSR用导航引导的16个稀疏token与时序自监督替代所有感知监督,实现高效高精度端到端自动驾驶。 · 文献 · 中文笔记 · 2026-07-19
Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision MakingSenna-2 通过一致性导向的三阶段训练(预训练、开环对齐、3DGS 中自底向上 HRL 闭环对齐),对齐 VLM 决策与 E2E 规划,实现更一致且更安全的决策与规划。 · 文献 · 中文笔记 · 2026-07-19
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous DrivingSenna通过LVLM输出自然语言高阶元动作、E2E条件生成低阶轨迹的解耦设计,配合规划导向QA与三阶段训练,实现SOTA规划并提升跨场景泛化。 · 文献 · 中文笔记 · 2026-07-19
Sparse4D v1 文献笔记如何在多相机 3D 检测中,以少量目标相关的 3D anchors 替代 dense BEV 网格,并融合跨帧观测。 · 文献 · 精读 · 2026-07-11
SparseDrive 文献笔记如何将 Sparse4D 风格的稀疏场景表示从检测与跟踪扩展到端到端自动驾驶规划。 · 文献 · 精读 · 2026-07-11
SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving足够密的因式分解静态词表配合粗粒度路径/速度打分+细粒度轨迹打分即可实现高效高质端到端规划,无需动态轨迹生成。 · 文献 · 中文笔记 · 2026-07-19
UniAD: Planning-oriented Autonomous DrivingUniAD以规划为导向,用统一query连接全栈感知-预测-规划模块,实现任务协同并在nuScenes上全面超越先前SOTA。 · 文献 · 中文笔记 · 2026-07-19
VAD: Vectorized Scene Representation for Efficient Autonomous DrivingVAD 将驾驶场景建模为全向量化表示(智能体运动向量与地图向量),通过查询交互与实例级规划约束实现高效、安全的端到端轨迹规划。 · 文献 · 精读 · 2026-07-20
nuScenes 数据模型nuScenes 场景、样本、传感器数据和标注表之间的关系。 · 笔记 · 2026-07-14
nuScenes: A Multimodal Dataset for Autonomous DrivingnuScenes是首个全传感器套件、含雷达与属性标注的大规模多模态自动驾驶数据集(1000个20s场景),并定义了基于中心距离的3D检测/跟踪指标与基线。 · 文献 · 精读 · 2026-07-14
检测与跟踪的状态生命周期从候选生成到身份维护和消亡的检测跟踪统一状态模型。 · 笔记 · 2026-07-11
矢量化场景表示与规划接口用实例向量(agent/车道/地图元素)替代稠密栅格作为端到端规划输入,换取效率与结构先验。 · 笔记 · 2026-07-20
自动驾驶自动驾驶感知、跟踪、预测、规划与系统评测的知识地图。 · Topics · 2026-07-19
自动驾驶复现 Smoke Test 路线按工程可控性排序的复现 smoke test 路线:数据、forward、checkpoint 与评测门槛。 · 项目 · 2026-07-20
自动驾驶数据集与评测矩阵自动驾驶感知、预测、规划与端到端驾驶的数据集、基准与开源强基线对照。 · 笔记 · 2026-07-17
自动驾驶数据集与评测矩阵开源优先的数据集与基准矩阵:感知、预测、规划与端到端驾驶的复现可行性。 · 项目 · 2026-07-20
自动驾驶方法谱系自动驾驶感知、预测、规划与端到端驾驶方法的技术继承关系地图,附论文与代码线索。 · 笔记 · 2026-07-17
自动驾驶方法谱系自动驾驶感知到端到端规划的方法继承地图:从 DETR 系到稀疏表示与规划接口。 · 项目 · 2026-07-20
轨迹优化与模型预测控制在动力学与避障约束下滚动求解有限时域最优控制,是可解释规划的经典骨干。 · 笔记 · 2026-07-20
闭环评测与开环指标开环拟合专家轨迹不等于可部署驾驶;闭环仿真/路测才暴露交互与恢复能力。 · 笔记 · 2026-07-20
closed-loop-evaluation
Section titled “closed-loop-evaluation”RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework for End-to-End DrivingRAD-2通过扩散生成器+RL判别器解耦、TC-GRPO时序一致优化与OGO纵向on-policy更新,结合BEV-Warp高吞吐特征级闭环仿真,将高维轨迹RL优化稳定化并显著降低碰撞率。 · 文献 · 中文笔记 · 2026-07-19
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS and Reinforcement LearningRAD通过大规模3DGS构建逼真数字孪生环境进行闭环RL训练端到端驾驶策略,并以IL正则化实现人-车对齐,显著降低闭环碰撞率。 · 文献 · 中文笔记 · 2026-07-19
决策视野与复合误差开环多步预测误差如何在闭环中放大,以及缩短依赖、重规划与世界模型的应对。 · 笔记 · 2026-07-20
闭环评测与开环指标开环拟合专家轨迹不等于可部署驾驶;闭环仿真/路测才暴露交互与恢复能力。 · 笔记 · 2026-07-20
computer-vision
Section titled “computer-vision”Query-based 检测范式用可学习 query 从多视角/BEV 特征中拉取实例,统一 2D DETR 到 3D 多相机检测的接口。 · 笔记 · 2026-07-20
集合预测与二分图匹配端到端检测如何用固定基数集合与 Hungarian 匹配替代 NMS 与启发式正负样本分配。 · 笔记 · 2026-07-20
diffusion-models
Section titled “diffusion-models”DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving提出截断扩散策略(锚定高斯+截断日程)与级联扩散解码器,使DiffusionDrive仅需2步去噪即可生成多样高质量驾驶轨迹,在NAVSIM达88.1 PDMS并以45 FPS实时运行。 · 文献 · 中文笔记 · 2026-07-19
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous DrivingDiffusionDriveV2用强化学习约束截断扩散的GMM多模态轨迹生成,兼顾多样性与高质量,在NAVSIM v1/v2上以ResNet-34达到91.2 PDMS / 85.5 EPDMS新纪录。 · 文献 · 中文笔记 · 2026-07-19
扩散模型扩散生成模型及其在表示、预测和策略生成中的学习入口。 · Topics · 2026-07-19
embodied-ai
Section titled “embodied-ai”世界模型如何服务策略用可学习动态模型做想象 rollout、规划或表征,而不仅是生成漂亮视频。 · 笔记 · 2026-07-20
控制动作的 Token 化把连续控制离散成 token,使 VLA/语言模型头能统一视觉-语言-动作建模。 · 笔记 · 2026-07-20
end-to-end-learning
Section titled “end-to-end-learning”DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving提出截断扩散策略(锚定高斯+截断日程)与级联扩散解码器,使DiffusionDrive仅需2步去噪即可生成多样高质量驾驶轨迹,在NAVSIM达88.1 PDMS并以45 FPS实时运行。 · 文献 · 中文笔记 · 2026-07-19
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous DrivingDiffusionDriveV2用强化学习约束截断扩散的GMM多模态轨迹生成,兼顾多样性与高质量,在NAVSIM v1/v2上以ResNet-34达到91.2 PDMS / 85.5 EPDMS新纪录。 · 文献 · 中文笔记 · 2026-07-19
GTRS: Generalized Trajectory Scoring for End-to-end Multimodal PlanningGTRS通过扩散轨迹生成、超密词汇dropout泛化与传感器增强+细化,实现端到端多模态规划中对静态/动态轨迹的鲁棒联合评分。 · 文献 · 中文笔记 · 2026-07-19
RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework for End-to-End DrivingRAD-2通过扩散生成器+RL判别器解耦、TC-GRPO时序一致优化与OGO纵向on-policy更新,结合BEV-Warp高吞吐特征级闭环仿真,将高维轨迹RL优化稳定化并显著降低碰撞率。 · 文献 · 中文笔记 · 2026-07-19
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS and Reinforcement LearningRAD通过大规模3DGS构建逼真数字孪生环境进行闭环RL训练端到端驾驶策略,并以IL正则化实现人-车对齐,显著降低闭环碰撞率。 · 文献 · 中文笔记 · 2026-07-19
SSR: Navigation-guided Sparse Scene Representation for End-to-End Autonomous DrivingSSR用导航引导的16个稀疏token与时序自监督替代所有感知监督,实现高效高精度端到端自动驾驶。 · 文献 · 中文笔记 · 2026-07-19
Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision MakingSenna-2 通过一致性导向的三阶段训练(预训练、开环对齐、3DGS 中自底向上 HRL 闭环对齐),对齐 VLM 决策与 E2E 规划,实现更一致且更安全的决策与规划。 · 文献 · 中文笔记 · 2026-07-19
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous DrivingSenna通过LVLM输出自然语言高阶元动作、E2E条件生成低阶轨迹的解耦设计,配合规划导向QA与三阶段训练,实现SOTA规划并提升跨场景泛化。 · 文献 · 中文笔记 · 2026-07-19
SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving足够密的因式分解静态词表配合粗粒度路径/速度打分+细粒度轨迹打分即可实现高效高质端到端规划,无需动态轨迹生成。 · 文献 · 中文笔记 · 2026-07-19
UniAD: Planning-oriented Autonomous DrivingUniAD以规划为导向,用统一query连接全栈感知-预测-规划模块,实现任务协同并在nuScenes上全面超越先前SOTA。 · 文献 · 中文笔记 · 2026-07-19
VAD: Vectorized Scene Representation for Efficient Autonomous DrivingVAD 将驾驶场景建模为全向量化表示(智能体运动向量与地图向量),通过查询交互与实例级规划约束实现高效、安全的端到端轨迹规划。 · 文献 · 精读 · 2026-07-20
决策视野与复合误差开环多步预测误差如何在闭环中放大,以及缩短依赖、重规划与世界模型的应对。 · 笔记 · 2026-07-20
控制动作的 Token 化把连续控制离散成 token,使 VLA/语言模型头能统一视觉-语言-动作建模。 · 笔记 · 2026-07-20
模仿学习与强化学习的分工行为克隆适合分布内演示;RL/离线 RL 适合闭环目标与长视野,但样本与安全约束更苛刻。 · 笔记 · 2026-07-20
端到端学习从低层输入到最终任务目标进行联合优化的方法与系统问题。 · Topics · 2026-07-19
集合预测与二分图匹配端到端检测如何用固定基数集合与 Hungarian 匹配替代 NMS 与启发式正负样本分配。 · 笔记 · 2026-07-20
generative-modeling
Section titled “generative-modeling”世界模型如何服务策略用可学习动态模型做想象 rollout、规划或表征,而不仅是生成漂亮视频。 · 笔记 · 2026-07-20
扩散模型扩散生成模型及其在表示、预测和策略生成中的学习入口。 · Topics · 2026-07-19
instance-memory
Section titled “instance-memory”Exploring Object-Centric Temporal Modeling for Efficient Multi-View 3D Object DetectionStreamPETR以对象查询帧间传播长期历史信息并结合运动感知层归一化,实现高效在线多视角3D目标检测。 · 文献 · 中文笔记 · 2026-07-19
时序 Instance Memory以实例状态跨帧传递信息的记忆机制与设计取舍。 · 笔记 · 2026-07-11
instance-state
Section titled “instance-state”检测与跟踪的状态生命周期从候选生成到身份维护和消亡的检测跟踪统一状态模型。 · 笔记 · 2026-07-11
motion-prediction
Section titled “motion-prediction”DTPP: Differentiable Joint Conditional Prediction and Cost Evaluation for Tree Policy PlanningDTPP通过查询中心Transformer高效生成ego-conditioned场景树,并与可学习上下文感知代价联合可微训练,提升树状策略规划质量与效率。 · 文献 · 中文笔记 · 2026-07-19
MTR: Motion Transformer with Global Intention Localization and Local Movement RefinementMTR采用静态意图查询与动态搜索查询构成的运动查询对,联合优化全局意图定位和局部轨迹精炼,实现高效准确的多模态运动预测。 · 文献 · 中文笔记 · 2026-07-19
轨迹优化与模型预测控制在动力学与避障约束下滚动求解有限时域最优控制,是可解释规划的经典骨干。 · 笔记 · 2026-07-20
multi-view-3d-detection
Section titled “multi-view-3d-detection”Query-based 检测范式用可学习 query 从多视角/BEV 特征中拉取实例,统一 2D DETR 到 3D 多相机检测的接口。 · 笔记 · 2026-07-20
multimodal
Section titled “multimodal”CMT: Cross Modal Transformer Towards Fast and Robust 3D Object DetectionCMT用坐标编码模块将3D位置隐式注入图像与点云token,位置引导查询直接与多模态特征交互,实现快速鲁棒端到端3D检测,nuScenes测试集单模型74.1% NDS。 · 文献 · 中文笔记 · 2026-07-19
navsim
Section titled “navsim”DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving提出截断扩散策略(锚定高斯+截断日程)与级联扩散解码器,使DiffusionDrive仅需2步去噪即可生成多样高质量驾驶轨迹,在NAVSIM达88.1 PDMS并以45 FPS实时运行。 · 文献 · 中文笔记 · 2026-07-19
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous DrivingDiffusionDriveV2用强化学习约束截断扩散的GMM多模态轨迹生成,兼顾多样性与高质量,在NAVSIM v1/v2上以ResNet-34达到91.2 PDMS / 85.5 EPDMS新纪录。 · 文献 · 中文笔记 · 2026-07-19
GTRS: Generalized Trajectory Scoring for End-to-end Multimodal PlanningGTRS通过扩散轨迹生成、超密词汇dropout泛化与传感器增强+细化,实现端到端多模态规划中对静态/动态轨迹的鲁棒联合评分。 · 文献 · 中文笔记 · 2026-07-19
SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving足够密的因式分解静态词表配合粗粒度路径/速度打分+细粒度轨迹打分即可实现高效高质端到端规划,无需动态轨迹生成。 · 文献 · 中文笔记 · 2026-07-19
nuplan
Section titled “nuplan”DTPP: Differentiable Joint Conditional Prediction and Cost Evaluation for Tree Policy PlanningDTPP通过查询中心Transformer高效生成ego-conditioned场景树,并与可学习上下文感知代价联合可微训练,提升树状策略规划质量与效率。 · 文献 · 中文笔记 · 2026-07-19
PLUTO: Pushing the Limit of Imitation Learning-based Planning for Autonomous DrivingPLUTO通过横向-纵向感知查询架构、可微插值辅助损失与对比模仿学习(CIL)框架,将基于模仿学习的自动驾驶规划推向极限,在nuPlan上取得SOTA闭环性能并首次超越顶级规则规划器。 · 文献 · 中文笔记 · 2026-07-19
nuscenes
Section titled “nuscenes”BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal TransformersBEVFormer通过预定义网格BEV查询与时空注意力,从多相机图像与历史BEV中自适应聚合信息,生成支持多感知任务的统一BEV特征。 · 文献 · 精读 · 2026-07-20
CMT: Cross Modal Transformer Towards Fast and Robust 3D Object DetectionCMT用坐标编码模块将3D位置隐式注入图像与点云token,位置引导查询直接与多模态特征交互,实现快速鲁棒端到端3D检测,nuScenes测试集单模型74.1% NDS。 · 文献 · 中文笔记 · 2026-07-19
DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D QueriesDETR3D用稀疏3D物体查询经相机矩阵投影到多视角2D特征,实现无深度估计、无NMS的set-to-set 3D检测。 · 文献 · 中文笔记 · 2026-07-19
Exploring Object-Centric Temporal Modeling for Efficient Multi-View 3D Object DetectionStreamPETR以对象查询帧间传播长期历史信息并结合运动感知层归一化,实现高效在线多视角3D目标检测。 · 文献 · 中文笔记 · 2026-07-19
PETR: Position Embedding Transformation for Multi-View 3D Object DetectionPETR通过3D位置嵌入变换将多视角2D特征转化为3D位置感知特征,实现简单端到端的多视角3D目标检测并取得SOTA。 · 文献 · 精读 · 2026-07-20
PETRv2: A Unified Framework for 3D Perception from Multi-Camera ImagesPETRv2通过扩展3D位置嵌入做时序建模并用任务特定查询支持多任务学习,在多相机3D感知上达到SOTA表现。 · 文献 · 中文笔记 · 2026-07-19
SSR: Navigation-guided Sparse Scene Representation for End-to-End Autonomous DrivingSSR用导航引导的16个稀疏token与时序自监督替代所有感知监督,实现高效高精度端到端自动驾驶。 · 文献 · 中文笔记 · 2026-07-19
UniAD: Planning-oriented Autonomous DrivingUniAD以规划为导向,用统一query连接全栈感知-预测-规划模块,实现任务协同并在nuScenes上全面超越先前SOTA。 · 文献 · 中文笔记 · 2026-07-19
VAD: Vectorized Scene Representation for Efficient Autonomous DrivingVAD 将驾驶场景建模为全向量化表示(智能体运动向量与地图向量),通过查询交互与实例级规划约束实现高效、安全的端到端轨迹规划。 · 文献 · 精读 · 2026-07-20
nuScenes 数据模型nuScenes 场景、样本、传感器数据和标注表之间的关系。 · 笔记 · 2026-07-14
nuScenes: A Multimodal Dataset for Autonomous DrivingnuScenes是首个全传感器套件、含雷达与属性标注的大规模多模态自动驾驶数据集(1000个20s场景),并定义了基于中心距离的3D检测/跟踪指标与基线。 · 文献 · 精读 · 2026-07-14
planning
Section titled “planning”DTPP: Differentiable Joint Conditional Prediction and Cost Evaluation for Tree Policy PlanningDTPP通过查询中心Transformer高效生成ego-conditioned场景树,并与可学习上下文感知代价联合可微训练,提升树状策略规划质量与效率。 · 文献 · 中文笔记 · 2026-07-19
DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving提出截断扩散策略(锚定高斯+截断日程)与级联扩散解码器,使DiffusionDrive仅需2步去噪即可生成多样高质量驾驶轨迹,在NAVSIM达88.1 PDMS并以45 FPS实时运行。 · 文献 · 中文笔记 · 2026-07-19
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous DrivingDiffusionDriveV2用强化学习约束截断扩散的GMM多模态轨迹生成,兼顾多样性与高质量,在NAVSIM v1/v2上以ResNet-34达到91.2 PDMS / 85.5 EPDMS新纪录。 · 文献 · 中文笔记 · 2026-07-19
GTRS: Generalized Trajectory Scoring for End-to-end Multimodal PlanningGTRS通过扩散轨迹生成、超密词汇dropout泛化与传感器增强+细化,实现端到端多模态规划中对静态/动态轨迹的鲁棒联合评分。 · 文献 · 中文笔记 · 2026-07-19
PLUTO: Pushing the Limit of Imitation Learning-based Planning for Autonomous DrivingPLUTO通过横向-纵向感知查询架构、可微插值辅助损失与对比模仿学习(CIL)框架,将基于模仿学习的自动驾驶规划推向极限,在nuPlan上取得SOTA闭环性能并首次超越顶级规则规划器。 · 文献 · 中文笔记 · 2026-07-19
SSR: Navigation-guided Sparse Scene Representation for End-to-End Autonomous DrivingSSR用导航引导的16个稀疏token与时序自监督替代所有感知监督,实现高效高精度端到端自动驾驶。 · 文献 · 中文笔记 · 2026-07-19
Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision MakingSenna-2 通过一致性导向的三阶段训练(预训练、开环对齐、3DGS 中自底向上 HRL 闭环对齐),对齐 VLM 决策与 E2E 规划,实现更一致且更安全的决策与规划。 · 文献 · 中文笔记 · 2026-07-19
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous DrivingSenna通过LVLM输出自然语言高阶元动作、E2E条件生成低阶轨迹的解耦设计,配合规划导向QA与三阶段训练,实现SOTA规划并提升跨场景泛化。 · 文献 · 中文笔记 · 2026-07-19
SparseDrive 文献笔记如何将 Sparse4D 风格的稀疏场景表示从检测与跟踪扩展到端到端自动驾驶规划。 · 文献 · 精读 · 2026-07-11
SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving足够密的因式分解静态词表配合粗粒度路径/速度打分+细粒度轨迹打分即可实现高效高质端到端规划,无需动态轨迹生成。 · 文献 · 中文笔记 · 2026-07-19
UniAD: Planning-oriented Autonomous DrivingUniAD以规划为导向,用统一query连接全栈感知-预测-规划模块,实现任务协同并在nuScenes上全面超越先前SOTA。 · 文献 · 中文笔记 · 2026-07-19
VAD: Vectorized Scene Representation for Efficient Autonomous DrivingVAD 将驾驶场景建模为全向量化表示(智能体运动向量与地图向量),通过查询交互与实例级规划约束实现高效、安全的端到端轨迹规划。 · 文献 · 精读 · 2026-07-20
决策视野与复合误差开环多步预测误差如何在闭环中放大,以及缩短依赖、重规划与世界模型的应对。 · 笔记 · 2026-07-20
模仿学习与强化学习的分工行为克隆适合分布内演示;RL/离线 RL 适合闭环目标与长视野,但样本与安全约束更苛刻。 · 笔记 · 2026-07-20
矢量化场景表示与规划接口用实例向量(agent/车道/地图元素)替代稠密栅格作为端到端规划输入,换取效率与结构先验。 · 笔记 · 2026-07-20
轨迹优化与模型预测控制在动力学与避障约束下滚动求解有限时域最优控制,是可解释规划的经典骨干。 · 笔记 · 2026-07-20
reinforcement-learning
Section titled “reinforcement-learning”DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous DrivingDiffusionDriveV2用强化学习约束截断扩散的GMM多模态轨迹生成,兼顾多样性与高质量,在NAVSIM v1/v2上以ResNet-34达到91.2 PDMS / 85.5 EPDMS新纪录。 · 文献 · 中文笔记 · 2026-07-19
RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework for End-to-End DrivingRAD-2通过扩散生成器+RL判别器解耦、TC-GRPO时序一致优化与OGO纵向on-policy更新,结合BEV-Warp高吞吐特征级闭环仿真,将高维轨迹RL优化稳定化并显著降低碰撞率。 · 文献 · 中文笔记 · 2026-07-19
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS and Reinforcement LearningRAD通过大规模3DGS构建逼真数字孪生环境进行闭环RL训练端到端驾驶策略,并以IL正则化实现人-车对齐,显著降低闭环碰撞率。 · 文献 · 中文笔记 · 2026-07-19
世界模型如何服务策略用可学习动态模型做想象 rollout、规划或表征,而不仅是生成漂亮视频。 · 笔记 · 2026-07-20
强化学习基于环境交互、回报和价值估计学习决策策略的知识入口。 · Topics · 2026-07-20
模仿学习与强化学习的分工行为克隆适合分布内演示;RL/离线 RL 适合闭环目标与长视野,但样本与安全约束更苛刻。 · 笔记 · 2026-07-20
reproduction
Section titled “reproduction”自动驾驶复现 Smoke Test 路线按工程可控性排序的复现 smoke test 路线:数据、forward、checkpoint 与评测门槛。 · 项目 · 2026-07-20
自动驾驶数据集与评测矩阵开源优先的数据集与基准矩阵:感知、预测、规划与端到端驾驶的复现可行性。 · 项目 · 2026-07-20
自动驾驶方法谱系自动驾驶感知到端到端规划的方法继承地图:从 DETR 系到稀疏表示与规划接口。 · 项目 · 2026-07-20
sparse-representation
Section titled “sparse-representation”BEV 稠密表征与稀疏实例表征鸟瞰稠密网格与稀疏 instance/query 在覆盖、算力、时序与下游规划接口上的取舍。 · 笔记 · 2026-07-20
矢量化场景表示与规划接口用实例向量(agent/车道/地图元素)替代稠密栅格作为端到端规划输入,换取效率与结构先验。 · 笔记 · 2026-07-20
稀疏时空采样稀疏查询如何在多视角与时间维度选择性聚合特征。 · 笔记 · 2026-07-11
sparse4d
Section titled “sparse4d”Sparse4D v1 文献笔记如何在多相机 3D 检测中,以少量目标相关的 3D anchors 替代 dense BEV 网格,并融合跨帧观测。 · 文献 · 精读 · 2026-07-11
Sparse4D v2 文献笔记如何将前一帧的高置信目标状态直接作为下一帧 decoder 的输入,以稳定地利用时序信息。 · 文献 · 精读 · 2026-07-11
Sparse4D v3 文献笔记如何在 v2 的 recurrent instance memory 上提升检测质量并输出稳定的跨帧目标 ID。 · 文献 · 精读 · 2026-07-11
sparsedrive
Section titled “sparsedrive”SparseDrive 文献笔记如何将 Sparse4D 风格的稀疏场景表示从检测与跟踪扩展到端到端自动驾驶规划。 · 文献 · 精读 · 2026-07-11
temporal-denoising
Section titled “temporal-denoising”Sparse4D v3 文献笔记如何在 v2 的 recurrent instance memory 上提升检测质量并输出稳定的跨帧目标 ID。 · 文献 · 精读 · 2026-07-11
temporal-fusion
Section titled “temporal-fusion”Sparse4D v2 文献笔记如何将前一帧的高置信目标状态直接作为下一帧 decoder 的输入,以稳定地利用时序信息。 · 文献 · 精读 · 2026-07-11
时序 Instance Memory以实例状态跨帧传递信息的记忆机制与设计取舍。 · 笔记 · 2026-07-11
稀疏时空采样稀疏查询如何在多视角与时间维度选择性聚合特征。 · 笔记 · 2026-07-11
tracking
Section titled “tracking”Sparse4D v3 文献笔记如何在 v2 的 recurrent instance memory 上提升检测质量并输出稳定的跨帧目标 ID。 · 文献 · 精读 · 2026-07-11
时序 Instance Memory以实例状态跨帧传递信息的记忆机制与设计取舍。 · 笔记 · 2026-07-11
检测与跟踪的状态生命周期从候选生成到身份维护和消亡的检测跟踪统一状态模型。 · 笔记 · 2026-07-11
trajectory-scoring
Section titled “trajectory-scoring”GTRS: Generalized Trajectory Scoring for End-to-end Multimodal PlanningGTRS通过扩散轨迹生成、超密词汇dropout泛化与传感器增强+细化,实现端到端多模态规划中对静态/动态轨迹的鲁棒联合评分。 · 文献 · 中文笔记 · 2026-07-19
SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving足够密的因式分解静态词表配合粗粒度路径/速度打分+细粒度轨迹打分即可实现高效高质端到端规划,无需动态轨迹生成。 · 文献 · 中文笔记 · 2026-07-19
verification
Section titled “verification”闭环评测与开环指标开环拟合专家轨迹不等于可部署驾驶;闭环仿真/路测才暴露交互与恢复能力。 · 笔记 · 2026-07-20
vision-language-model
Section titled “vision-language-model”Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision MakingSenna-2 通过一致性导向的三阶段训练(预训练、开环对齐、3DGS 中自底向上 HRL 闭环对齐),对齐 VLM 决策与 E2E 规划,实现更一致且更安全的决策与规划。 · 文献 · 中文笔记 · 2026-07-19
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous DrivingSenna通过LVLM输出自然语言高阶元动作、E2E条件生成低阶轨迹的解耦设计,配合规划导向QA与三阶段训练,实现SOTA规划并提升跨场景泛化。 · 文献 · 中文笔记 · 2026-07-19
控制动作的 Token 化把连续控制离散成 token,使 VLA/语言模型头能统一视觉-语言-动作建模。 · 笔记 · 2026-07-20