Transformers 文档

DEIMv2

Hugging Face's logo
加入 Hugging Face 社区

并获得增强的文档体验

开始使用

该模型于 2025 年 9 月 25 日发布在 HF papers 上,并于 2026 年 4 月 27 日贡献给 Hugging Face Transformers。

DEIMv2

概述

DEIMv2 (DETR with Improved Matching v2) 由 Shihua Huang、Yongjie Hou、Longfei Liu、Xuanlong Yu 和 Xi Shen 在论文 DEIMv2: Real-Time Object Detection Meets DINOv3 中提出。

论文摘要如下:

得益于简单有效的 Dense O2O(密集一对一匹配),DEIM 展现出了更快的收敛速度和更强的性能。在这项工作中,我们将其扩展并集成了 DINOv3 特征,从而形成了 DEIMv2。DEIMv2 涵盖了从 X 到 Atto 共八种模型尺寸,满足 GPU、边缘端和移动端的部署需求。对于 X、L、M 和 S 变体,我们采用了 DINOv3 预训练/蒸馏的主干网络,并引入了空间调优适配器(Spatial Tuning Adapter, STA),它能高效地将 DINOv3 的单尺度输出转化为多尺度特征,并将强语义与细粒度细节相结合以增强检测效果。对于超轻量级模型(Nano、Pico、Femto 和 Atto),我们采用经过深度和宽度剪枝的 HGNetv2,以满足严格的资源预算。结合简化的解码器和升级的 Dense O2O,这种统一的设计使 DEIMv2 在各种场景下都能实现卓越的性能-成本权衡,并确立了新的最先进(SOTA)结果。值得注意的是,我们最大的模型 DEIMv2-X 在仅有 5030 万参数的情况下实现了 57.8 的 AP,超越了此前需要超过 6000 万参数才能达到 56.5 AP 的 X 规模模型。在轻量化方面,DEIMv2-S 是首个在 COCO 上超过 50 AP 里程碑(达到 50.9 AP)的 10M 以下规模模型(971 万参数)。即使是仅有 150 万参数的超轻量级 DEIMv2-Pico,也能提供 38.5 的 AP,与参数量多出约 50% 的 YOLOv10-Nano(230 万参数)性能相当。

用法

from transformers import AutoImageProcessor, AutoModelForObjectDetection
from transformers.image_utils import load_image

url = "http://images.cocodataset.org/val2017/000000039769.jpg"
image = load_image(url)

image_processor = AutoImageProcessor.from_pretrained("harshaljanjani/DEIMv2_HGNetv2_N_COCO_Transformers")
model = AutoModelForObjectDetection.from_pretrained("harshaljanjani/DEIMv2_HGNetv2_N_COCO_Transformers", device_map="auto")

inputs = image_processor(images=image, return_tensors="pt").to(model.device)
outputs = model(**inputs)

results = image_processor.post_process_object_detection(
    outputs, threshold=0.5, target_sizes=[image.size[::-1]]
)

for result in results:
    for score, label, box in zip(result["scores"], result["labels"], result["boxes"]):
        box = [round(i, 2) for i in box.tolist()]
        print(f"Detected {model.config.id2label[label.item()]} with confidence {round(score.item(), 3)} at location {box}")

Deimv2Config

class transformers.Deimv2Config

< >

(配置参数列表略,保持原有结构)

参数

  • is_encoder_decoder (bool, optional, 默认为 True) — 模型是否用作编码器/解码器。
  • initializer_range (float, optional, 默认为 0.01) — 用于初始化所有权重矩阵的 truncated_normal_initializer 的标准差。
  • initializer_bias_prior_prob (float, optional) — 偏置初始化器用于初始化 enc_score_headclass_embed 偏置的先验概率。如果为 None,则在初始化模型权重时计算 prior_prob = 1 / (num_labels + 1)
  • layer_norm_eps (float, optional, 默认为 1e-05) — 层归一化层使用的 epsilon 值。
  • batch_norm_eps (float, optional, 默认为 1e-05) — 批归一化层使用的 epsilon 值。
  • backbone_config (Union[dict, ~configuration_utils.PreTrainedConfig], optional) — 主干网络模型的配置。
  • freeze_backbone_batch_norms (bool, optional, 默认为 True) — 是否冻结主干网络中的批归一化层。
  • encoder_hidden_dim (int, optional, 默认为 256) — 隐藏层表示的维度。
  • encoder_in_channels (list, optional, 默认为 [512, 1024, 2048]) — 编码器的多级输入特征。
  • feat_strides (list[int], optional, 默认为 [8, 16, 32]) — 每个特征图使用的步长(stride)。
  • encoder_layers (int, optional, 默认为 1) — Transformer 编码器中的隐藏层数量。如果未设置,将使用与 num_layers 相同的值。
  • encoder_ffn_dim (int, 可选, 默认为 1024) — 编码器中“中间”层(通常称为前馈层)的维度。
  • encoder_attention_heads (int, 可选, 默认为 8) — Transformer 编码器中每个注意力层的注意力头数。
  • dropout (Union[float, int], 可选, 默认为 0.0) — 所有 dropout 层的比率。
  • activation_dropout (Union[float, int], 可选, 默认为 0.0) — 全连接层内部激活值的 dropout 比率。
  • encode_proj_layers (list[int], 可选, 默认为 [2]) — 编码器中使用的投影层索引。
  • positional_encoding_temperature (int, 可选, 默认为 10000) — 用于创建位置编码的温度参数。
  • encoder_activation_function (str, 可选, 默认为 "gelu") — 编码器和池化层中的非线性激活函数(函数或字符串)。
  • activation_function (str, 可选, 默认为 silu) — 解码器中的非线性激活函数(函数或字符串)。例如 "gelu", "relu", "silu" 等。
  • eval_size (list[int]tuple[int, int], 可选) — 在考虑步长(stride)后,用于计算位置嵌入有效高度和宽度的评估图像尺寸。
  • normalize_before (bool, 可选, 默认为 False) — 确定是否在自注意力层和前馈模块之前应用层归一化(Transformer 编码器层中)。
  • hidden_expansion (float, 可选, 默认为 1.0) — 用于放大 RepVGGBlock 和 CSPRepLayer 维度大小的扩展比例。
  • d_model (int, 可选, 默认为 256) — 编码器层和池化层的大小。
  • num_queries (int, 可选, 默认为 300) — 对象查询的数量。
  • decoder_in_channels (list, 可选, 默认为 [256, 256, 256]) — 解码器的多级特征维度。
  • decoder_ffn_dim (int, 可选, 默认为 1024) — 解码器中“中间”层(通常称为前馈层)的维度。
  • num_feature_levels (int, 可选, 默认为 3) — 输入特征的层级数。
  • decoder_n_points (int, 可选, 默认为 4) — 解码器中每个注意力头在每个特征层级上采样的键数。
  • decoder_layers (int, 可选, 默认为 6) — Transformer 解码器中的隐藏层数。如果未设置,将使用与 num_layers 相同的值。
  • decoder_attention_heads (int, 可选, 默认为 8) — Transformer 解码器中每个注意力层的注意力头数。
  • decoder_activation_function (str, 可选, 默认为 "relu") — 解码器中的非线性激活函数(函数或字符串)。
  • attention_dropout (Union[float, int], 可选, 默认为 0.0) — 注意力概率的 dropout 比率。
  • num_denoising (int, 可选, 默认为 100) — 用于对比去噪(contrastive denoising)的去噪任务或查询的总数。
  • label_noise_ratio (float, 可选, 默认为 0.5) — 应添加随机噪声的去噪标签比例。
  • box_noise_scale (float, 可选, 默认为 1.0) — 要添加到边界框的噪声规模或幅度。
  • learn_initial_query (bool, 可选, 默认为 False) — 表示在训练期间是否应学习解码器的初始查询嵌入。
  • anchor_image_size (tuple[int, int], 可选) — 评估期间用于生成边界框锚点的输入图像高度和宽度。
  • with_box_refine (bool, 可选, 默认为 True) — 是否应用迭代边界框精细化。
  • matcher_alpha (float, 可选, 默认为 0.25) — 匈牙利匹配器(Hungarian Matcher)使用的 alpha 参数。
  • matcher_gamma (float, 可选, 默认为 2.0) — 匈牙利匹配器使用的 gamma 参数。
  • matcher_class_cost (float, 可选, 默认为 2.0) — 匈牙利匹配器使用的类别损失的相对权重。
  • matcher_bbox_cost (float, 可选, 默认为 5.0) — 匈牙利匹配器使用的边界框损失的相对权重。
  • matcher_giou_cost (float, 可选, 默认为 2.0) — 匈牙利匹配器使用的 GIoU 损失的相对权重。
  • use_focal_loss (bool, optional, 默认为 True) — 用于指示是否使用 Focal Loss 的参数。
  • auxiliary_loss (bool, optional, 默认为 True) — 是否使用辅助解码损失(即每个解码器层处的损失)。
  • focal_loss_alpha (float, optional, 默认为 0.75) — 用于计算 Focal Loss 的 alpha 参数。
  • focal_loss_gamma (float, optional, 默认为 2.0) — 用于计算 Focal Loss 的 gamma 参数。
  • weight_loss_vfl (float, optional, 默认为 1.0) — 目标检测损失中 Varifocal Loss 的相对权重。
  • weight_loss_bbox (float, optional, 默认为 5.0) — 目标检测损失中 L1 边界框损失的相对权重。
  • weight_loss_giou (float, optional, 默认为 2.0) — 目标检测损失中广义 IoU 损失的相对权重。
  • weight_loss_fgl (float, optional, 默认为 0.15) — 目标检测损失中细粒度定位损失的相对权重。
  • weight_loss_ddf (float, optional, 默认为 1.5) — 目标检测损失中解耦蒸馏 Focal Loss 的相对权重。
  • eos_coefficient (float, optional, 默认为 0.0001) — 目标检测损失中“无物体”(no-object)类别的相对分类权重。
  • eval_idx (int, optional, 默认为 -1) — 用于评估的解码器层索引。
  • layer_scale (float, optional, 默认为 1.0) — 后续解码器层中隐藏维度的缩放因子。
  • max_num_bins (int, optional, 默认为 32) — 用于基于分布引导的边界框细化的最大箱数(bins)。
  • reg_scale (float, optional, 默认为 4.0) — 回归分布的缩放因子。
  • depth_mult (float, optional, 默认为 1.0) — RepNCSPELAN5 层中块数的乘数。
  • top_prob_values (int, optional, 默认为 4) — 每个角点分布中需要考虑的最高概率值的数量。
  • lqe_hidden_dim (int, optional, 默认为 64) — 位置质量估计器(LQE)网络的隐藏维度大小。
  • lqe_layers (int, optional, 默认为 2) — 位置质量估计器 MLP 中的层数。
  • decoder_offset_scale (float, optional, 默认为 0.5) — 可变形注意力(deformable attention)中使用的偏移缩放比例。
  • decoder_method (str, optional, 默认为 "default") — 解码器使用的方法:"default""discrete"
  • up (float, optional, 默认为 0.5) — 控制加权函数(Weighting Function)的上限。
  • tie_word_embeddings (bool, optional, 默认为 True) — 是否根据模型的 tied_weights_keys 映射来绑定权重嵌入。
  • weight_loss_mal (float, optional, 默认为 1.0) — 目标检测损失中匹配辅助损失(Matching Auxiliary Loss)的相对权重。
  • use_dense_one_to_one (bool, optional, 默认为 True) — 是否在解码器层间使用稠密的一对一匹配。
  • mal_alpha (float, optional) — 匹配辅助损失(MAL)的 Alpha 参数。如果为 None,则使用 focal_loss_alpha
  • encoder_fuse_op (str, optional, 默认为 "sum") — 编码器 FPN 中使用的融合操作。DEIMv2 使用 "sum" 而不是 D-FINE 中的 "cat"
  • spatial_tuning_adapter_inplanes (int, optional, 默认为 16) — STA 卷积主干(convolutional stem)的输入平面数量。
  • encoder_type (str, optional, 默认为 "hybrid") — 要使用的编码器类型。"hybrid" 使用包含 AIFI、FPN 和 PAN 的完整 HybridEncoder。"lite" 为较小的变体(Atto, Femto, Pico)使用带有 GAP 融合的轻量级 LiteEncoder。
  • use_gateway (bool, optional, 默认为 True) — 是否在解码器层中使用网关机制(交叉注意力门控)。当为 False 时,改用编码器注意力输出上的 RMSNorm。
  • share_bbox_head (bool, optional, 默认为 False) — 是否在所有解码器层之间共享边界框预测头。
  • encoder_has_trailing_conv (bool, optional, defaults to True) — 编码器的 CSP 块在瓶颈路径后是否包含一个 3x3 的尾部卷积。对于 RepNCSPELAN4(由 HGNetV2 N 和 LiteEncoder 变体使用)为 True。对于 RepNCSPELAN5(由 DINOv3 变体使用)为 False

这是用于存储 Deimv2Model 配置的配置类。它根据指定的参数实例化 Deimv2 模型,从而定义模型架构。使用默认值实例化配置将产生与 Intellindust/DEIMv2_HGNetv2_N_COCO 类似的配置。

配置对象继承自 PreTrainedConfig,可用于控制模型输出。阅读 PreTrainedConfig 的文档以获取更多信息。

Deimv2Model

class transformers.Deimv2Model

< >

( config: Deimv2Config )

参数

  • config (Deimv2Config) — 具有模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。

RT-DETR 模型(由主干网络和编码器-解码器组成),输出原始的隐藏状态,顶部没有任何 head。

该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。

此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。

forward

< >

( pixel_values: FloatTensor pixel_mask: torch.LongTensor | None = None encoder_outputs: torch.FloatTensor | None = None inputs_embeds: torch.FloatTensor | None = None labels: list[dict] | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) Deimv2ModelOutputtuple(torch.FloatTensor)

参数

  • pixel_values (形状为 (batch_size, num_channels, image_size, image_size)torch.FloatTensor) — 对应于输入图像的张量。像素值可以使用 image_processor_class 获取。有关详细信息,请参阅 image_processor_class.__call__processor_class 使用 image_processor_class 进行图像处理)。
  • pixel_mask (形状为 (batch_size, height, width)torch.LongTensor可选) — 用于避免对填充像素值执行注意力机制的掩码。掩码值在 [0, 1] 中选择:

    • 1 表示真实的像素(即未被掩码),
    • 0 表示填充像素(即被掩码)。

    什么是注意力掩码?

  • encoder_outputs (torch.FloatTensor可选) — 元组包含 (last_hidden_state, 可选: hidden_states, 可选: attentions),其中形状为 (batch_size, sequence_length, hidden_size)last_hidden_state可选)是编码器最后一层输出的隐藏状态序列。用于解码器的交叉注意力机制中。
  • inputs_embeds (形状为 (batch_size, sequence_length, hidden_size)torch.FloatTensor可选) — 可选地,你可以选择直接传入图像的扁平化表示,而不是传入扁平化的特征图(主干网络 + 投影层的输出)。
  • labels (长度为 (batch_size,)list[Dict]可选) — 用于计算二分匹配损失的标签。这是一个字典列表,每个字典至少包含以下两个键:‘class_labels’ 和 ‘boxes’(分别是批次中图像的类别标签和边界框)。类别标签本身应该是一个长度为 (图像中边界框数量,)torch.LongTensor,而框应该是形状为 (图像中边界框数量, 4)torch.FloatTensor

返回

Deimv2ModelOutputtuple(torch.FloatTensor)

一个 Deimv2ModelOutput 或一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置(None)和输入包含各种元素。

Deimv2Model 的前向传播(forward)方法,重写了 __call__ 特殊方法。

虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用 Module 实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。

  • last_hidden_state (torch.FloatTensor, 形状为 (batch_size, num_queries, hidden_size)) — 模型解码器最后一层输出的隐藏状态序列。

  • intermediate_hidden_states (torch.FloatTensor, 形状为 (batch_size, config.decoder_layers, num_queries, hidden_size)) — 堆叠的中间隐藏状态(解码器每层的输出)。

  • intermediate_logits (torch.FloatTensor,形状为 (batch_size, config.decoder_layers, sequence_length, config.num_labels)) — 堆叠的中间 logits(解码器每一层的 logits)。

  • intermediate_reference_points (torch.FloatTensor, 形状为 (batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间参考点(解码器每层的参考点)。

  • intermediate_predicted_corners (torch.FloatTensor,形状为 (batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间预测角点(解码器每一层的预测角点)。

  • initial_reference_points (torch.FloatTensor,形状为 (batch_size, num_queries, 4)) — 用于第一个解码器层的初始参考点。

  • decoder_hidden_states (tuple[torch.FloatTensor], 可选, 当传递 output_hidden_states=True 或当 config.output_hidden_states=True 时返回) — torch.FloatTensor 元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为 (batch_size, sequence_length, hidden_size)

    解码器在每一层输出时的隐藏状态以及初始嵌入输出。

  • decoder_attentions (tuple[torch.FloatTensor], 可选, 当传递 output_attentions=True 或当 config.output_attentions=True 时返回) — torch.FloatTensor 元组(每一层一个),形状为 (batch_size, num_heads, sequence_length, sequence_length)

    解码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。

  • cross_attentions (tuple[torch.FloatTensor], 可选,当传入 output_attentions=Trueconfig.output_attentions=True 时返回) — torch.FloatTensor 元组(每层一个),形状为 (batch_size, num_heads, sequence_length, sequence_length)

    解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。

  • encoder_last_hidden_state (形状为 (batch_size, sequence_length, hidden_size)torch.FloatTensor, 可选, 默认为 None) — 模型编码器最后一层输出的隐状态序列。

  • encoder_hidden_states (tuple[torch.FloatTensor], 可选, 当传递 output_hidden_states=True 或当 config.output_hidden_states=True 时返回) — torch.FloatTensor 元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为 (batch_size, sequence_length, hidden_size)

    编码器在每一层输出时的隐藏状态以及初始嵌入输出。

  • encoder_attentions (tuple[torch.FloatTensor], 可选, 当传递 output_attentions=True 或当 config.output_attentions=True 时返回) — torch.FloatTensor 元组(每一层一个),形状为 (batch_size, num_heads, sequence_length, sequence_length)

    编码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。

  • init_reference_points (torch.FloatTensor, 形状为 (batch_size, num_queries, 4)) — 通过 Transformer 解码器发送的初始参考点。

  • enc_topk_logits (torch.FloatTensor of shape (batch_size, sequence_length, config.num_labels)) — 在编码器阶段中,预测的边界框分数,其中得分最高的 config.two_stage_num_proposals 个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。

  • enc_topk_bboxes (torch.FloatTensor,形状为 (batch_size, sequence_length, 4)) — 编码器阶段预测的边界框坐标的 logits。

  • enc_outputs_class (torch.FloatTensor of shape (batch_size, sequence_length, config.num_labels), optional, returned when config.with_box_refine=True and config.two_stage=True) — 在第一阶段中,预测的边界框分数,其中得分最高的 config.two_stage_num_proposals 个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。

  • enc_outputs_coord_logits (torch.FloatTensor of shape (batch_size, sequence_length, 4), optional, returned when config.with_box_refine=True and config.two_stage=True) — 第一阶段中预测边界框坐标的对数。

  • denoising_meta_values (dict可选,默认为 None) — 用于去噪相关值的额外字典。

示例

>>> from transformers import AutoImageProcessor, Deimv2Model
>>> from PIL import Image
>>> import httpx
>>> from io import BytesIO

>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> with httpx.stream("GET", url) as response:
...     image = Image.open(BytesIO(response.read()))

>>> image_processor = AutoImageProcessor.from_pretrained("PekingU/Deimv2_r50vd")
>>> model = Deimv2Model.from_pretrained("PekingU/Deimv2_r50vd")

>>> inputs = image_processor(images=image, return_tensors="pt")

>>> outputs = model(**inputs)

>>> last_hidden_states = outputs.last_hidden_state
>>> list(last_hidden_states.shape)
[1, 300, 256]

Deimv2ForObjectDetection

class transformers.Deimv2ForObjectDetection

< >

( config: Deimv2Config )

参数

  • config (Deimv2Config) — 具有模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。

RT-DETR 模型(由主干网络和编码器-解码器组成),输出边界框和 logits,以便进一步解码为分数和类别。

该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。

此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。

forward

< >

( pixel_values: FloatTensor pixel_mask: torch.LongTensor | None = None encoder_outputs: torch.FloatTensor | None = None inputs_embeds: torch.FloatTensor | None = None labels: list[dict] | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) Deimv2ObjectDetectionOutputtuple(torch.FloatTensor)

参数

  • pixel_values (形状为 (batch_size, num_channels, image_size, image_size)torch.FloatTensor) — 对应于输入图像的张量。像素值可以使用 image_processor_class 获取。有关详细信息,请参阅 image_processor_class.__call__processor_class 使用 image_processor_class 进行图像处理)。
  • pixel_mask (形状为 (batch_size, height, width)torch.LongTensor可选) — 用于避免对填充像素值执行注意力机制的掩码。掩码值在 [0, 1] 中选择:

    • 1 表示真实的像素(即未被掩码),
    • 0 表示填充像素(即被掩码)。

    什么是注意力掩码?

  • encoder_outputs (torch.FloatTensor可选) — 元组包含 (last_hidden_state, 可选: hidden_states, 可选: attentions),其中形状为 (batch_size, sequence_length, hidden_size)last_hidden_state可选)是编码器最后一层输出的隐藏状态序列。用于解码器的交叉注意力机制中。
  • inputs_embeds (形状为 (batch_size, sequence_length, hidden_size)torch.FloatTensor可选) — 可选地,你可以选择直接传入嵌入表示,而不是传入 input_ids。如果你想比模型内部的嵌入查找矩阵更精细地控制如何将 input_ids 索引转换为关联向量,这会很有用。
  • labels (形状为 (batch_size, sequence_length)list[dict]可选) — 用于计算掩码语言模型损失的标签。索引应该在 [0, ..., config.vocab_size] 之间或为 -100(参见 input_ids 文档字符串)。索引设置为 -100 的标记将被忽略(掩码),损失仅针对标签在 [0, ..., config.vocab_size] 中的标记计算。

返回

Deimv2ObjectDetectionOutputtuple(torch.FloatTensor)

一个 Deimv2ObjectDetectionOutput 或一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置(None)和输入包含各种元素。

Deimv2ForObjectDetection 的前向传播(forward)方法,重写了 __call__ 特殊方法。

虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用 Module 实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。

  • loss (torch.FloatTensor of shape (1,), optional, 当提供labels时返回)) — 总损失,是类别预测的负对数似然(交叉熵)和边界框损失的线性组合。后者定义为 L1 损失和广义尺度不变 IoU 损失的线性组合。

  • loss_dict (Dict, 可选) — 包含各个损失的字典。用于日志记录。

  • logits (形状为 (batch_size, num_queries, num_classes + 1)torch.FloatTensor) — 所有查询的分类 logits(包括无对象)。

  • pred_boxes (形状为 (batch_size, num_queries, 4)torch.FloatTensor) — 所有查询的归一化框坐标,表示为 (center_x, center_y, width, height)。这些值在 [0, 1] 之间归一化,相对于批次中每个图像的大小(忽略可能的填充)。你可以使用 ~Deimv2ImageProcessor.post_process_object_detection 来获取未归一化的(绝对)边界框。

  • auxiliary_outputs (list[Dict], optional) — 可选,仅在启用了辅助损失(即config.auxiliary_loss设置为True)且提供了标签时返回。它是一个字典列表,包含每个解码器层的上述两个键(logitspred_boxes)。

  • last_hidden_state (torch.FloatTensor, 形状为 (batch_size, num_queries, hidden_size)) — 模型解码器最后一层输出的隐藏状态序列。

  • intermediate_hidden_states (torch.FloatTensor, 形状为 (batch_size, config.decoder_layers, num_queries, hidden_size)) — 堆叠的中间隐藏状态(解码器每层的输出)。

  • intermediate_logits (torch.FloatTensor,形状为 (batch_size, config.decoder_layers, num_queries, config.num_labels)) — 堆叠的中间 logits(解码器每一层的 logits)。

  • intermediate_reference_points (torch.FloatTensor, 形状为 (batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间参考点(解码器每层的参考点)。

  • intermediate_predicted_corners (torch.FloatTensor,形状为 (batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间预测角点(解码器每一层的预测角点)。

  • initial_reference_points (torch.FloatTensor,形状为 (batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的初始参考点(解码器每一层的初始参考点)。

  • decoder_hidden_states (tuple[torch.FloatTensor], 可选, 当传递 output_hidden_states=True 或当 config.output_hidden_states=True 时返回) — torch.FloatTensor 元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为 (batch_size, sequence_length, hidden_size)

    解码器在每一层输出时的隐藏状态以及初始嵌入输出。

  • decoder_attentions (tuple[torch.FloatTensor], 可选, 当传递 output_attentions=True 或当 config.output_attentions=True 时返回) — torch.FloatTensor 元组(每一层一个),形状为 (batch_size, num_heads, sequence_length, sequence_length)

    解码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。

  • cross_attentions (tuple[torch.FloatTensor], 可选,当传入 output_attentions=Trueconfig.output_attentions=True 时返回) — torch.FloatTensor 元组(每层一个),形状为 (batch_size, num_heads, sequence_length, sequence_length)

    解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。

  • encoder_last_hidden_state (形状为 (batch_size, sequence_length, hidden_size)torch.FloatTensor, 可选, 默认为 None) — 模型编码器最后一层输出的隐状态序列。

  • encoder_hidden_states (tuple[torch.FloatTensor], 可选, 当传递 output_hidden_states=True 或当 config.output_hidden_states=True 时返回) — torch.FloatTensor 元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为 (batch_size, sequence_length, hidden_size)

    编码器在每一层输出时的隐藏状态以及初始嵌入输出。

  • encoder_attentions (tuple[torch.FloatTensor], 可选, 当传递 output_attentions=True 或当 config.output_attentions=True 时返回) — torch.FloatTensor 元组(每一层一个),形状为 (batch_size, num_heads, sequence_length, sequence_length)

    编码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。

  • init_reference_points (torch.FloatTensor, 形状为 (batch_size, num_queries, 4)) — 通过 Transformer 解码器发送的初始参考点。

  • enc_topk_logits (torch.FloatTensor of shape (batch_size, sequence_length, config.num_labels), optional, returned when config.with_box_refine=True and config.two_stage=True) — 编码器中预测边界框坐标的对数几率。

  • enc_topk_bboxes (torch.FloatTensor of shape (batch_size, sequence_length, 4), optional, returned when config.with_box_refine=True and config.two_stage=True) — 编码器中预测边界框坐标的对数几率。

  • enc_outputs_class (torch.FloatTensor of shape (batch_size, sequence_length, config.num_labels), optional, returned when config.with_box_refine=True and config.two_stage=True) — 在第一阶段中,预测的边界框分数,其中得分最高的 config.two_stage_num_proposals 个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。

  • enc_outputs_coord_logits (torch.FloatTensor of shape (batch_size, sequence_length, 4), optional, returned when config.with_box_refine=True and config.two_stage=True) — 第一阶段中预测边界框坐标的对数。

  • denoising_meta_values (dict,*可选*,默认为 None) — 用于去噪相关值的额外字典

示例

>>> import torch
>>> from transformers.image_utils import load_image
>>> from transformers import AutoImageProcessor, Deimv2ForObjectDetection

>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> image = load_image(url)

>>> image_processor = AutoImageProcessor.from_pretrained("harshaljanjani/DEIMv2_HGNetv2_N_COCO_Transformers")
>>> model = Deimv2ForObjectDetection.from_pretrained("harshaljanjani/DEIMv2_HGNetv2_N_COCO_Transformers")

>>> # prepare image for the model
>>> inputs = image_processor(images=image, return_tensors="pt")

>>> # forward pass
>>> outputs = model(**inputs)

>>> logits = outputs.logits
>>> list(logits.shape)
[1, 300, 80]

>>> boxes = outputs.pred_boxes
>>> list(boxes.shape)
[1, 300, 4]

>>> # convert outputs (bounding boxes and class logits) to Pascal VOC format (xmin, ymin, xmax, ymax)
>>> target_sizes = torch.tensor([image.size[::-1]])
>>> results = image_processor.post_process_object_detection(outputs, threshold=0.9, target_sizes=target_sizes)
>>> result = results[0]  # first image in batch

>>> for score, label, box in zip(result["scores"], result["labels"], result["boxes"]):
...     box = [round(i, 2) for i in box.tolist()]
...     print(
...         f"Detected {model.config.id2label[label.item()]} with confidence "
...         f"{round(score.item(), 3)} at location {box}"
...     )
在 GitHub 上更新

© . This site is unofficial and not affiliated with Hugging Face, Inc.