跳转到内容

A Survey of Deep Learning-Based Object Detection

A Survey of Deep Learning-Based Object Detection

Section titled “A Survey of Deep Learning-Based Object Detection”

⚠️ AI 生成 · 建议对照原文 本页为自动整理的学习笔记;关键数据与引用如需引用,请回查 PDF / 官方版本。

学习档位 中文笔记

类型 文献 · 更新 2026-07-19

所属 场景表示与长期记忆

中文学习笔记(自动生成,需核验)

Section titled “中文学习笔记(自动生成,需核验)”

Topic: scene-representation-memory · Tier: foundational · Year: 2019 · Venue:
Evidence level: partial · 本地全文: 是 · 建议阅读: ~60 分钟
Paper: https://arxiv.org/abs/1907.09408
Code:
Generator: grok

系统综述深度学习目标检测发展脉络,清晰区分两阶段与一阶段检测器、典型基线(R-CNN系列、YOLO等)、backbone选择、数据集与应用场景,并指出发展趋势,适合快速把握领域全貌与经典方法取舍。

本文系统综述深度学习目标检测方法,重点分析两阶段与一阶段检测器架构、典型基线、数据集及应用,并讨论高效系统构建与发展趋势。

目标检测是计算机视觉中定位数字图像/视频中特定类别语义对象实例(如人、车、建筑)的任务,需同时完成分类与定位,广泛应用于安防、自动驾驶、交通监控、无人机场景分析与机器人视觉等,并面临精度与推理速度的权衡。

卷积神经网络基础与常见backbone(VGG、ResNet等)、目标检测基本概念(bounding box、IoU、mAP、region proposal、RoI)、分类任务预训练与微调流程。

  • 列出近期新颖解决方案并聚焦前沿,便于读者快速了解领域前沿
  • 系统全面回顾深度学习目标检测方法,尤其是截至当时的最新检测方案与重要研究趋势
  • 在多方面进行深入分析与讨论(作者称其中许多为本领域首次)

首先分析现有典型检测模型方法并描述基准数据集;随后系统概述一阶段与两阶段目标检测方法;列出传统与新应用;分析目标检测的若干代表性分支;最后讨论如何利用这些方法构建有效高效系统,并指出一系列发展趋势。

Backbone作为特征提取器(高精度深网络如ResNet/ResNeXt/AmoebaNet vs 轻量如MobileNet/ShuffleNet/SqueezeNet/Xception/MobileNetV2,可增删或替换层);两阶段检测器以RoI pooling为分界(第一阶段RPN生成候选框,第二阶段提取特征做分类与回归);一阶段直接从输入预测框(无proposal,速度更快);多尺度锚框/FPN(自底向上+自顶向下+横向连接)处理尺度变化;RoIAlign(双线性插值避免量化对齐误差)替代RoI pooling;端到端多任务损失联合训练;预训+微调策略。取舍在于精度(两阶段+深backbone+FPN)与速度(一阶段+轻量backbone)。

常用基准包括Caltech、KITTI、ImageNet、PASCAL VOC、MS COCO、Open Images V5以及VisDrone(无人机平台数据集);指标涉及mAP、box AP、推理时间(ms/s/image)、帧率(fps)等。具体实验设置与完整对比待来源核验。

摘录中有限证据:Fast R-CNN在PASCAL VOC 2007上mAP为66.9%(R-CNN为66.0%),训练时间9.5小时(R-CNN 84小时),测试速率0.32s/image(带truncated SVD,R-CNN 47s),在Nvidia K40 GPU上;Faster R-CNN在同一测试集mAP 69.9%(Fast R-CNN 66.9%),总运行时间198ms(Fast R-CNN 1830ms),处理速率5fps vs 0.5fps(共享VGG backbone);Mask R-CNN使用ResNet-FPN backbone提升1.7 box AP,RoIAlign操作提升1.1 box AP(MS COCO检测数据集)。其他结果待来源核验。

作为2019年综述(arXiv v2截至2019年10月),主要覆盖此前方法,后续发展未纳入;精度-速度权衡仍是核心挑战(两阶段准但慢,一阶段快但定位/识别精度相对低);小目标、多尺度、实时与移动端部署等场景对backbone与架构设计要求高;摘录有限,完整失败场景与适用边界待来源核验。

与前序 / 同期 / 后续方法的关系

Section titled “与前序 / 同期 / 后续方法的关系”

建立在早期方法(推荐参考[12][13][14]了解细节)与R-CNN系列基础上;两阶段以Faster R-CNN为代表,一阶段以YOLO、SSD为代表;与同期backbone改进(ResNet替代VGG)及FPN等多尺度方法密切相关;后续可沿其趋势继续演进。

本综述论文本身无官方代码实现;复现建议从各典型基线原论文入手(如Faster R-CNN、YOLO、Mask R-CNN等)并使用公开数据集(VOC/COCO)与标准指标;具体链接与复现细节待来源核验。

先读引言与贡献(把握综述定位)→ Backbone Networks(特征提取基础)→ Typical Baselines(先两阶段R-CNN/Fast/Faster/Mask,再一阶段YOLO等)→ 数据集与指标 → 一般方法分析与应用分支 → 发展趋势;重点对照图1架构与具体模块取舍。

  1. Q: 两阶段与一阶段检测器的主要区别是什么?各自代表方法与优缺点? A: 两阶段以RoI pooling为分界,先生成region proposals(如Faster R-CNN的RPN)再分类回归,精度高但较慢;一阶段直接预测框(如YOLO、SSD),无proposal步骤,速度快适合实时但精度相对低。
  2. Q: R-CNN的四个模块分别是什么?为何需要warp region proposals? A: 1.生成类别无关region proposals(selective search);2.从每个proposal提取固定长度特征向量(CNN);3.类别特定线性SVM分类;4.bounding-box回归。因全连接层需固定长度输入,将不同尺寸proposal warp到固定227×227。
  3. Q: Fast R-CNN相对R-CNN的主要改进有哪些? A: 整图提取特征后经RoI pooling得到固定尺寸特征(共享计算);端到端多任务损失联合训练;用RoI pooling保留空间信息无需warp;truncated SVD加速全连接层;显著减少训练/测试时间与存储。
  4. Q: Faster R-CNN如何加速region proposal生成?锚框设计是什么? A: 用RPN(全卷积网络)替代selective search,共享卷积特征;在最后共享卷积层输出上滑窗,使用3尺度×3长宽比共k个锚框作为参考,预测相对偏移。
  5. Q: Mask R-CNN中FPN与RoIAlign的作用分别是什么? A: FPN通过自底向上路径、自顶向下上采样与横向连接构建多尺度特征金字塔,利于不同尺度目标;RoIAlign用双线性插值避免RoI pooling的两次量化,消除对齐误差,提升定位精度。
  • page 1, Abstract: in this survey, we first analyze the methods of existing typical detection models and describe the benchmark datasets. Afterwards and primarily, we provide a comprehensive overview of a variety of object detection methods in a systematic manner, covering the one-stage and two-stage detectors.
  • page 1, Introduction: Two-stage detectors have high localization and object recognition accuracy, whereas the one-stage detectors achieve high inference speed. The two stages of two-stage detectors can be divided by RoI (Region of Interest) pooling layer.
  • page 1, Contributions: (1) This paper lists very novel solutions proposed recently but neglects to discuss the basics so that readers can see the cutting edge of the field more easily. (2) Moreover, different from previous object detection surveys, this paper systematically and comprehensively reviews deep learning based object detection methods…
  • page 3-4, Fast R-CNN: Experiment results showed that Fast R-CNN had 66.9% mAP while R-CNN of 66.0% on PASCAL VOC 2007 dataset [4]. Training time dropped to 9.5 hours as compared to R-CNN with 84h, 9 times faster. For test rate (s/image), Fast R-CNN with truncated SVD (0.32s) was 213× faster than R-CNN (47s).
  • page 4, Faster R-CNN: On PASCAL VOC 2007 test set, Faster R-CNN achieved mAP of 69.9% as compared to Fast R-CNN of 66.9% with shared convolutional computations. As well, total running time of Faster R-CNN (198ms) was nearly 10 times lower than Fast R-CNN (1830ms) with the same VGG [26] backbone, and processing rate was 5fps vs. 0.5fps.
  • page 4, Mask R-CNN: Using ResNet-FPN backbone improved 1.7 points box AP and RoIAlign operation improved 1.1 points box AP on MS COCO detection dataset.
  • topic: autonomous-driving
  • sources: openalex
  • retrieved_at: 2026-07-20
  • query: autonomous driving survey end-to-end perception planning
  • doi: 10.1109/access.2019.2939201
  • score_total: 52
  • suggested_tier: foundational

(no prose relevance explanation — numeric score only or HTTP source)

(no snippet evidence in candidate pool)

生成:2026-07-21 · 来源条数 2 · 模型 heuristic · 需人工核验数字

围绕「A Survey of Deep Learning-Based Object Detection」的核心问题与动机(待结合全文核验)。

  • 见原文方法章节;以下为基于摘要/摘录的要点提示。
  • 1 …

与相近工作的关系待核验;请对照 related work。

  • 勿仅凭摘要推断未给出的数值指标。
  1. 这篇工作的输入/输出表示是什么?(A Survey of Deep Learning-Based Object Detection)
  2. 训练目标与评测协议各是什么?
  3. 主要失败模式或局限是什么?
flowchart LR
A["输入 / 观测"] --> B["表示 / 编码"]
B --> C["推理 / 解码"]
C --> D["输出 / 动作或检测"]
%% method sketch for: A Survey of Deep Learning-Based Object Detection

方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。

A Survey of Deep Learning-Based Object Detection arch p.1

来源:原论文约 p.1(arch);学习用途摘录。

A Survey of Deep Learning-Based Object Detection table p.11

来源:原论文约 p.11(table);学习用途摘录。

展开英文 Paper Card / AI deep analysis
Field Content
Year 2019
Authors Licheng Jiao, Fan Zhang, Fang Liu, Shuyuan Yang, Lingling Li, Zhixi Feng, Rong Qu
arXiv 1907.09408
DOI 10.1109/access.2019.2939201
Topics scene-representation-memory
Paper https://arxiv.org/abs/1907.09408
展开 Extract / Selections / Local assets
  • scene-representation-memory: tier=foundational rank=1 score=50 — auto refresh 2026-07-19 sources=openalex
(no PDF text available; metadata-only card)