跳转到内容

OW-DETR: Open-world Detection Transformer

⚠️ AI 生成 · 建议对照原文 本页为自动整理的学习笔记;关键数据与引用如需引用,请回查 PDF / 官方版本。

学习档位 中文笔记

类型 文献 · 更新 2026-07-19

所属 Query-based 检测与集合预测

中文学习笔记(自动生成,需核验)

Section titled “中文学习笔记(自动生成,需核验)”

Topic: foundations · Tier: watch · Year: 2022 · Venue:
Evidence level: partial · 本地全文: 是 · 建议阅读: ~45 分钟
Paper: https://arxiv.org/abs/2112.01513
Code:
Generator: grok

将Transformer(Deformable DETR)首次系统引入开放世界目标检测(OWOD),针对未知物体提案质量、未知与背景分离、多尺度上下文建模三大挑战,设计了注意力驱动伪标签、新颖性分类与物体性评分三大组件,且无需未知物体监督,更贴近真实开放世界场景,并在MS-COCO与PASCAL VOC上显著优于ORE等前期方法。

OW-DETR基于Deformable DETR,通过注意力伪标签+新颖性分类+物体性分支,在无未知监督下实现更好的开放世界检测与增量学习。

开放世界目标检测(OWOD)要求模型在每个训练episode中检测已知类别集合Kt,同时将未见物体识别为未知类(标签0),并将部分未知实例提交oracle标注后增量加入已知类,在有限记忆下持续更新而不从零重训,挑战包括:为潜在未知生成高质量候选框、利用已知知识分离未知与背景、检测不同尺度多样未知物体并建模其上下文关系。

标准目标检测与DETR/Deformable DETR(多尺度可变形注意力、可学习object queries、二分图匹配损失);开放世界/增量学习基本概念;伪标签与对比/能量基分类等前期OWOD方法(尤其ORE)的不足。

  • 提出基于Transformer的开放世界检测器OW-DETR,利用多尺度自注意力与可变形感受野更好建模上下文,减少归纳偏置与开放世界假设。
  • 引入注意力驱动伪标签方案:将高注意力分数且不匹配任何已知框的object query选为未知类。
  • 引入新颖性分类分支,用伪未知与真实已知学习区分未知与已知。
  • 引入物体性分支,通过已知到未知的前景特性知识迁移,学习前景(已知+伪未知)与背景的分离。
  • 在MS-COCO与PASCAL VOC上验证有效性,未知召回与增量检测均优于ORE与相关SOTA。

图像经backbone提取多尺度D维特征 → 输入可变形encoder-decoder(配合M个可学习object queries)→ decoder输出M个query embedding qe → 分别送入box回归分支Freg、新颖性分类分支Fcls(已知+未知)、物体性分支Fobj;用二分图匹配选中匹配已知GT的query,剩余query基于backbone中间特征注意力图A计算区域objectness分数so,取top-ku高分者伪标为未知;用已知GT+伪未知联合训练三分支,端到端优化新颖性损失Ln + 物体性损失Lo + 回归损失Lr。

1)注意力驱动伪标签:对未匹配已知的query,用注意力图A在其预测框区域取均值作为so,top-ku选伪未知(优于RPN类提案的已知偏置);2)新颖性分类Fcls:单层FFN,将类别扩展为C+1(含未知标签0),直接用伪未知监督,无需held-out未知验证集;3)物体性Fobj:单层FFN,学习前景(已知+伪未知)vs背景,实现从已知到未知的前景特性迁移;整体基于DDETR多尺度可变形注意力以编码长程多尺度上下文并减少归纳偏置。取舍:完全无未知监督、单阶段、依赖伪标签质量与注意力图可靠性。

主要在MS-COCO与PASCAL VOC两个基准上进行OWOD与增量目标检测实验;报告未知召回(unknown recall)等指标;增量设置中对先前类仅用有界记忆少量样本。具体任务协议与完整指标定义待来源核验。

在MS-COCO上,OW-DETR相对近期OWOD方法ORE在未知召回上取得1.8%到3.3%的绝对提升;在PASCAL VOC增量目标检测所有设置上均优于SOTA。详细分任务/消融数值待来源核验。

完全依赖伪标签质量,注意力图可能受已知类别偏置影响;未知类内部多样性建模仍依赖单一未知类标签与伪样本;增量阶段记忆有界,长期灾难性遗忘风险存在;提取中未详细讨论失败场景与适用边界,待来源核验。

与前序 / 同期 / 后续方法的关系

Section titled “与前序 / 同期 / 后续方法的关系”

直接改进ORE(基于Faster R-CNN两阶段、RPN伪未知、能量基分类器与held-out未知分布估计、单原型聚类)的不足;适配标准Deformable DETR(多尺度可变形注意力、少归纳偏置);与传统闭世界检测、开放集识别、增量检测相关,后续工作可在此基础上扩展更强伪标签或持续学习机制。

官方代码https://github.com/akshitac8/OW-DETR;建议基于Deformable DETR实现,严格按伪标签选择(注意力图+top-ku)、三分支联合损失复现;注意无未知监督设置与有界记忆增量协议,优先复现MS-COCO未知召回与PASCAL VOC增量结果。

先读Abstract与Introduction(问题与ORE局限)→ Contributions与Fig.1/2整体框架 → Sec.2.1-2.5方法细节(伪标签、新颖性、物体性、多尺度编码)→ 实验部分(待完整)→ 结论与代码。

  1. Q: OW-DETR针对OWOD的三大核心挑战是什么? A: 生成潜在未知的高质量候选提案、将未知与背景分离、检测多尺度多样未知并建模上下文。
  2. Q: 注意力驱动伪标签如何选择伪未知query? A: 对未匹配已知GT的query,用backbone注意力图A在其预测框区域计算均值objectness分数so,取top-ku高分者伪标为未知。
  3. Q: 新颖性分类分支与标准DDETR分类分支的关键区别? A: 扩展为C+1类(含未知标签0),直接用伪未知监督训练,无需held-out未知验证集或能量分布估计。
  4. Q: 物体性分支的作用是什么? A: 学习前景(已知+伪未知)与背景的分离,促进从已知类向未知类迁移前景物体特性。
  5. Q: 相对ORE,OW-DETR在MS-COCO未知召回上的提升是多少? A: 绝对增益1.8%到3.3%。
  • Abstract (page 1): Our model outperforms the recently introduced OWOD approach, ORE, with absolute gains ranging from 1.8% to 3.3% in terms of unknown recall on MS-COCO. In the case of incremental object detection, OW-DETR outperforms the state-of-the-art for all settings on PASCAL VOC. Our code is available at https://github.com/akshitac8/OW-DETR.
  • Contributions (page 2): We propose a transformer-based open-world detector, OW-DETR, that better models the context with multi-scale self-attention and deformable receptive fields, in addition to fewer assumptions about the open-world setup along with reduced inductive biases.
  • Sec. 2.1 Overall Architecture (page 3): Our approach adapts the standard Deformable DETR for the OWOD problem formulation by introducing (i) an attention driven pseudo-labeling scheme to select the candidate unknown queries, (ii) a novelty classification branch Fcls to distinguish the pseudo unknowns from each of the known classes and (iii) an objectness branch Fobj that learns to separate foreground objects (known + pseudo unknowns) from the background.
  • Sec. 2.3 Attention-driven Pseudo-labeling (page 4): The top-ku queries among M−K with the high objectness scores so are then pseudo-labeled as unknown objects with bounding boxes given by their corresponding regression branch predictions.
  • Introduction / ORE limitations (page 2): ORE relies on a held-out validation set with weak supervision for the unknowns… ORE learns the unknown category with a single latent prototype, which is insufficient… ORE does not explicitly encode long-range dependencies due to a convolution-based design.
  • topic: foundations
  • sources: openalex
  • retrieved_at: 2026-07-20
  • query: End-to-End Object Detection with Transformers DETR
  • doi: 10.1109/cvpr52688.2022.00902
  • score_total: 58
  • suggested_tier: recent

(no prose relevance explanation — numeric score only or HTTP source)

(no snippet evidence in candidate pool)

生成:2026-07-21 · 来源条数 2 · 模型 heuristic · 需人工核验数字

围绕「OW-DETR: Open-world Detection Transformer」的核心问题与动机(待结合全文核验)。

  • 见原文方法章节;以下为基于摘要/摘录的要点提示。
  • OW-DETR: Open-world Detection Transformer Akshita Gupta* 1 Sanath Narayan* 1 K J Joseph2,4 Salman Kh…

与相近工作的关系待核验;请对照 related work。

  • 勿仅凭摘要推断未给出的数值指标。
  1. 这篇工作的输入/输出表示是什么?(OW-DETR: Open-world Detection Transformer)
  2. 训练目标与评测协议各是什么?
  3. 主要失败模式或局限是什么?
flowchart LR
A["输入 / 观测"] --> B["表示 / 编码"]
B --> C["推理 / 解码"]
C --> D["输出 / 动作或检测"]
%% method sketch for: OW-DETR: Open-world Detection Transformer

方法结构示意(重绘;细节以原论文为准,待 PDF 核验)。

OW-DETR: Open-world Detection Transformer arch p.1

来源:原论文约 p.1(arch);学习用途摘录。

OW-DETR: Open-world Detection Transformer table p.10

来源:原论文约 p.10(table);学习用途摘录。

展开英文 Paper Card / AI deep analysis
Field Content
Year 2022
Authors Akshita Gupta, Sanath Narayan, K J Joseph, Salman Khan, Fahad Shahbaz Khan, Mubarak Shah
arXiv 2112.01513
DOI 10.1109/cvpr52688.2022.00902
Topics foundations
Paper https://arxiv.org/abs/2112.01513
展开 Extract / Selections / Local assets
  • foundations: tier=watch rank=3 score=58 — auto refresh 2026-07-19 sources=openalex
(no PDF text available; metadata-only card)