跳转到内容

模型部署与推理优化

量化、蒸馏、推理引擎与端侧/车载部署优化。

类型 Topics · 更新 2026-07-19

本Topic聚焦自动驾驶与具身智能场景下模型从训练到实际部署的推理优化问题。核心是在资源受限边缘设备上实现低延迟、高吞吐、能效可控的深度模型推理,涵盖量化压缩、稀疏化、多尺度特征高效处理、边缘协作检测与实时视频流处理。需解决全精度大模型在车载/机器人平台内存带宽与算力不足、端到端检测器计算瓶颈、多模态长距离感知实时性、以及部署导向模型尺度与分辨率联合优化等矛盾,使模型满足实时安全关键控制要求,同时保持检测/规划/控制精度。强调从云端重型训练向边缘轻量推理的迁移路径与系统级权衡。

  • 大规模分布式训练系统细节与并行策略实现
  • 从零训练新骨干网络或完整感知算法设计
  • 非实时离线批处理推理或纯云端服务架构
  • 硬件电路级加速器设计与制造
  • foundations — 需掌握目标检测基础架构如DETR系列、多模态感知与BEV表示,理解object query与encoder-decoder计算瓶颈
  • systems-engineering — 需了解边缘计算、实时系统约束与部署流水线,支撑延迟与资源权衡分析
  • training-systems — 需理解训练时模型规模与并行对推理部署的影响,便于量化与稀疏化前的模型选择
术语 含义 常见混淆
量化(Quantization) 将浮点权重与激活映射到低比特整数表示以降低存储与计算开销的推理优化技术 易与剪枝混淆,量化主要改精度而非结构稀疏;后训练量化与量化感知训练路径不同
边缘推理(Edge Inference) 在资源受限设备如车载芯片或机器人本地执行模型前向,强调低延迟与能效 非简单模型缩小,需结合硬件亲和、批处理与协作感知
延迟(Latency) 从输入到输出完整推理耗时,实时系统关键指标 与吞吐量不同,单样本延迟优化常牺牲批处理效率
稀疏化(Sparsity) 选择性更新或丢弃部分token/特征以减少计算,如可学习编码器token选择 静态剪枝与动态可学习稀疏机制在训练与推理阶段处理不同
部署导向优化(Deployment-Oriented Optimization) 联合调整模型尺度、输入分辨率与推理配置以匹配目标硬件与场景 非单纯精度优先,需平衡缺陷检测等任务精度与实时约束
dense prior 用类似RPN的密集提案与编码器特征初始化object container,加速端到端检测收敛 与随机query初始化相对,改变decoder层数需求

早期依赖全精度云端大模型与重型decoder堆叠,推理成本高、延迟难控。随后转向量化与硬件加速综述指导下的压缩部署,以及可学习稀疏与dense prior初始化简化结构。当前范式强调边缘协作、实时多车辆感知与部署联合优化模型尺度分辨率,将效率从训练后处理融入端到端设计与系统级权衡。

  1. A Survey of Quantization Methods for Efficient Neural Network Inference(精读)— 系统梳理量化方法,是推理优化基础必读,支撑边缘部署精度-效率权衡理解
  2. Efficient Acceleration of Deep Learning Inference on Resource-Constrained Edge Devices: A Review(精读)— 全面综述资源受限边缘设备上的推理加速技术,覆盖硬件与算法协同
  3. Sparse DETR: Efficient End-to-End Object Detection with Learnable Sparsity(中文笔记)— 展示可学习token稀疏化在检测器中的应用,降低计算并保持性能,适合效率机制学习
  1. 先读量化与边缘加速两篇综述建立方法全景与术语基础
  2. 再读Sparse DETR与Efficient DETR理解检测器结构简化与稀疏机制
  3. 最后浏览部署导向YOLO优化、边缘协作检测与LLaVA-Mini等近期工作,联系实际场景权衡
Paper 输入 输出 表示 训练目标
Sparse DETR: Efficient End-to-End Object Detection with Learnable Sparsity 多尺度图像特征 目标检测框与类别 可学习稀疏编码器token与解码器交叉注意力图 降低计算量同时保持或提升检测性能
Efficient DETR: Improving End-to-End Object Detector with Dense Prior 图像 目标检测结果 dense prior初始化的object container与浅层decoder 加速收敛并简化结构接近深层性能
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token 图像或视频 多模态理解与生成 单视觉token高效表示 降低多模态大模型推理开销
Edge-Enabled Collaborative Object Detection for Real-Time Multi-Vehicle Perception 多车辆感知数据 实时目标检测 边缘协作实现多车实时感知
Deployment-Oriented Joint Optimization of YOLO11 Model Scale and Inference Resolution for Photovoltaic Defect Detection 光伏缺陷图像 缺陷检测结果 联合模型尺度与分辨率优化以适配部署
  • 量化后精度下降导致安全关键感知漏检或误检
  • 稀疏选择机制在极端天气或长距离场景不稳定
  • 边缘设备内存带宽不足引发实际延迟超预期
  • 多车辆协作通信开销与同步失败
  • 部署配置与训练分布不匹配造成域偏移
  • 如何在强实时约束下联合优化量化、稀疏与协作策略而不牺牲鲁棒性
  • 部署导向尺度分辨率搜索的自动化与硬件感知泛化
  • 机密实时推理与边缘多模态大模型效率的平衡
  • 长距离多模态感知在资源受限平台的统一高效框架
  1. 量化与稀疏化在推理优化中的核心差异是什么?各自适用场景?
  2. Sparse DETR如何通过可学习机制选择编码器token?其辅助损失作用为何?
  3. Efficient DETR中dense prior如何解决object container初始化问题并简化decoder?
  4. 边缘协作目标检测相比单车本地推理的主要工程风险有哪些?
  5. 部署导向联合优化模型尺度与推理分辨率时需权衡哪些指标?

本 Topic registry 入选 16 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
recent Efficient DETR: Improving End-to-End Object Detector with Dense Prior 2021 cross-topic assign from registry title match=1 keywords; 202
recent Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM 2021 cross-topic assign from registry title match=1 keywords; 202
recent Sparse DETR: Efficient End-to-End Object Detection with Learnable Sparsity 2021 cross-topic assign from registry title match=1 keywords; 202
recent aiMotive Dataset: A Multimodal Dataset for Robust Autonomous Driving with Long-Range Perception 2022 auto refresh 2026-07-19 sources=arxiv
watch VIPeR: Provably Efficient Algorithm for Offline RL with Neural Function Approximation 2023 cross-topic assign from registry title match=1 keywords; 202
watch EGA-Depth: Efficient Guided Attention for Self-Supervised Multi-Camera Depth Estimation 2023 cross-topic assign from registry title match=1 keywords; 202
watch RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control 2023 cross-topic assign from registry title match=1 keywords; 202
watch LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token 2025 cross-topic assign from registry title match=1 keywords; 202
watch MoE Parallel Folding: Heterogeneous Parallelism Mappings for Efficient Large-Scale MoE Model Training with Megatron Core 2025 cross-topic assign from registry title match=1 keywords; 202
watch Edge-Enabled Collaborative Object Detection for Real-Time Multi-Vehicle Perception 2025 auto score=40
watch Edge Computing for Low-Latency Video Streaming 2025 auto score=40
recent Smarter eco-cities and their leading-edge artificial intelligence of things solutions for environmental sustainability: A comprehensive systematic review 2023 auto refresh 2026-07-19 sources=openalex
watch Deployment-Oriented Joint Optimization of YOLO11 Model Scale and Inference Resolution for Photovoltaic Defect Detection 2026 auto score=40
foundational Efficient Acceleration of Deep Learning Inference on Resource-Constrained Edge Devices: A Review 2022 Proc. IEEE review efficient acceleration of DL inference on
foundational A Survey of Quantization Methods for Efficient Neural Network Inference 2022 Survey of quantization methods for efficient neural network
foundational DeepTrust^RT: Confidential Deep Neural Inference Meets Real-Time! 2024 auto refresh 2026-07-19 sources=openalex

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 0 · 待获取 PDF 3)

Section titled “基础必读(选题 3 · 可学习 0 · 待获取 PDF 3)”

本档尚无可学习正文(PDF/中文笔记);下列为待获取选题。

  • A Survey of Quantization Methods for Efficient Neural Network Inference (2022) · 待获取 PDF
  • Efficient Acceleration of Deep Learning Inference on Resource-Constrained Edge Devices: A Review (2022) · 待获取 PDF
  • DeepTrust^RT: Confidential Deep Neural Inference Meets Real-Time! (2024) · 待获取 PDF

近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)

Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”

观察清单(选题 8 · 可学习 8 · 待获取 PDF 0)

Section titled “观察清单(选题 8 · 可学习 8 · 待获取 PDF 0)”

成熟度 seed · 内容数 16 · 论文池 16