Transformers 文档
DEIMv2
并获得增强的文档体验
开始使用
该模型于 2025 年 9 月 25 日发布在 HF papers 上,并于 2026 年 4 月 27 日贡献给 Hugging Face Transformers。
DEIMv2
概述
DEIMv2 (DETR with Improved Matching v2) 由 Shihua Huang、Yongjie Hou、Longfei Liu、Xuanlong Yu 和 Xi Shen 在论文 DEIMv2: Real-Time Object Detection Meets DINOv3 中提出。
论文摘要如下:
得益于简单有效的 Dense O2O(密集一对一匹配),DEIM 展现出了更快的收敛速度和更强的性能。在这项工作中,我们将其扩展并集成了 DINOv3 特征,从而形成了 DEIMv2。DEIMv2 涵盖了从 X 到 Atto 共八种模型尺寸,满足 GPU、边缘端和移动端的部署需求。对于 X、L、M 和 S 变体,我们采用了 DINOv3 预训练/蒸馏的主干网络,并引入了空间调优适配器(Spatial Tuning Adapter, STA),它能高效地将 DINOv3 的单尺度输出转化为多尺度特征,并将强语义与细粒度细节相结合以增强检测效果。对于超轻量级模型(Nano、Pico、Femto 和 Atto),我们采用经过深度和宽度剪枝的 HGNetv2,以满足严格的资源预算。结合简化的解码器和升级的 Dense O2O,这种统一的设计使 DEIMv2 在各种场景下都能实现卓越的性能-成本权衡,并确立了新的最先进(SOTA)结果。值得注意的是,我们最大的模型 DEIMv2-X 在仅有 5030 万参数的情况下实现了 57.8 的 AP,超越了此前需要超过 6000 万参数才能达到 56.5 AP 的 X 规模模型。在轻量化方面,DEIMv2-S 是首个在 COCO 上超过 50 AP 里程碑(达到 50.9 AP)的 10M 以下规模模型(971 万参数)。即使是仅有 150 万参数的超轻量级 DEIMv2-Pico,也能提供 38.5 的 AP,与参数量多出约 50% 的 YOLOv10-Nano(230 万参数)性能相当。
用法
from transformers import AutoImageProcessor, AutoModelForObjectDetection
from transformers.image_utils import load_image
url = "http://images.cocodataset.org/val2017/000000039769.jpg"
image = load_image(url)
image_processor = AutoImageProcessor.from_pretrained("harshaljanjani/DEIMv2_HGNetv2_N_COCO_Transformers")
model = AutoModelForObjectDetection.from_pretrained("harshaljanjani/DEIMv2_HGNetv2_N_COCO_Transformers", device_map="auto")
inputs = image_processor(images=image, return_tensors="pt").to(model.device)
outputs = model(**inputs)
results = image_processor.post_process_object_detection(
outputs, threshold=0.5, target_sizes=[image.size[::-1]]
)
for result in results:
for score, label, box in zip(result["scores"], result["labels"], result["boxes"]):
box = [round(i, 2) for i in box.tolist()]
print(f"Detected {model.config.id2label[label.item()]} with confidence {round(score.item(), 3)} at location {box}")Deimv2Config
class transformers.Deimv2Config
< 源代码 >(配置参数列表略,保持原有结构)
参数
- is_encoder_decoder (
bool, optional, 默认为True) — 模型是否用作编码器/解码器。 - initializer_range (
float, optional, 默认为0.01) — 用于初始化所有权重矩阵的 truncated_normal_initializer 的标准差。 - initializer_bias_prior_prob (
float, optional) — 偏置初始化器用于初始化enc_score_head和class_embed偏置的先验概率。如果为None,则在初始化模型权重时计算prior_prob = 1 / (num_labels + 1)。 - layer_norm_eps (
float, optional, 默认为1e-05) — 层归一化层使用的 epsilon 值。 - batch_norm_eps (
float, optional, 默认为1e-05) — 批归一化层使用的 epsilon 值。 - backbone_config (
Union[dict, ~configuration_utils.PreTrainedConfig], optional) — 主干网络模型的配置。 - freeze_backbone_batch_norms (
bool, optional, 默认为True) — 是否冻结主干网络中的批归一化层。 - encoder_hidden_dim (
int, optional, 默认为256) — 隐藏层表示的维度。 - encoder_in_channels (
list, optional, 默认为[512, 1024, 2048]) — 编码器的多级输入特征。 - feat_strides (
list[int], optional, 默认为[8, 16, 32]) — 每个特征图使用的步长(stride)。 - encoder_layers (
int, optional, 默认为1) — Transformer 编码器中的隐藏层数量。如果未设置,将使用与num_layers相同的值。 - encoder_ffn_dim (
int, 可选, 默认为1024) — 编码器中“中间”层(通常称为前馈层)的维度。 - encoder_attention_heads (
int, 可选, 默认为8) — Transformer 编码器中每个注意力层的注意力头数。 - dropout (
Union[float, int], 可选, 默认为0.0) — 所有 dropout 层的比率。 - activation_dropout (
Union[float, int], 可选, 默认为0.0) — 全连接层内部激活值的 dropout 比率。 - encode_proj_layers (
list[int], 可选, 默认为[2]) — 编码器中使用的投影层索引。 - positional_encoding_temperature (
int, 可选, 默认为 10000) — 用于创建位置编码的温度参数。 - encoder_activation_function (
str, 可选, 默认为"gelu") — 编码器和池化层中的非线性激活函数(函数或字符串)。 - activation_function (
str, 可选, 默认为silu) — 解码器中的非线性激活函数(函数或字符串)。例如"gelu","relu","silu"等。 - eval_size (
list[int]或tuple[int, int], 可选) — 在考虑步长(stride)后,用于计算位置嵌入有效高度和宽度的评估图像尺寸。 - normalize_before (
bool, 可选, 默认为False) — 确定是否在自注意力层和前馈模块之前应用层归一化(Transformer 编码器层中)。 - hidden_expansion (
float, 可选, 默认为 1.0) — 用于放大 RepVGGBlock 和 CSPRepLayer 维度大小的扩展比例。 - d_model (
int, 可选, 默认为256) — 编码器层和池化层的大小。 - num_queries (
int, 可选, 默认为 300) — 对象查询的数量。 - decoder_in_channels (
list, 可选, 默认为[256, 256, 256]) — 解码器的多级特征维度。 - decoder_ffn_dim (
int, 可选, 默认为1024) — 解码器中“中间”层(通常称为前馈层)的维度。 - num_feature_levels (
int, 可选, 默认为 3) — 输入特征的层级数。 - decoder_n_points (
int, 可选, 默认为 4) — 解码器中每个注意力头在每个特征层级上采样的键数。 - decoder_layers (
int, 可选, 默认为6) — Transformer 解码器中的隐藏层数。如果未设置,将使用与num_layers相同的值。 - decoder_attention_heads (
int, 可选, 默认为8) — Transformer 解码器中每个注意力层的注意力头数。 - decoder_activation_function (
str, 可选, 默认为"relu") — 解码器中的非线性激活函数(函数或字符串)。 - attention_dropout (
Union[float, int], 可选, 默认为0.0) — 注意力概率的 dropout 比率。 - num_denoising (
int, 可选, 默认为 100) — 用于对比去噪(contrastive denoising)的去噪任务或查询的总数。 - label_noise_ratio (
float, 可选, 默认为 0.5) — 应添加随机噪声的去噪标签比例。 - box_noise_scale (
float, 可选, 默认为 1.0) — 要添加到边界框的噪声规模或幅度。 - learn_initial_query (
bool, 可选, 默认为False) — 表示在训练期间是否应学习解码器的初始查询嵌入。 - anchor_image_size (
tuple[int, int], 可选) — 评估期间用于生成边界框锚点的输入图像高度和宽度。 - with_box_refine (
bool, 可选, 默认为True) — 是否应用迭代边界框精细化。 - matcher_alpha (
float, 可选, 默认为 0.25) — 匈牙利匹配器(Hungarian Matcher)使用的 alpha 参数。 - matcher_gamma (
float, 可选, 默认为 2.0) — 匈牙利匹配器使用的 gamma 参数。 - matcher_class_cost (
float, 可选, 默认为 2.0) — 匈牙利匹配器使用的类别损失的相对权重。 - matcher_bbox_cost (
float, 可选, 默认为 5.0) — 匈牙利匹配器使用的边界框损失的相对权重。 - matcher_giou_cost (
float, 可选, 默认为 2.0) — 匈牙利匹配器使用的 GIoU 损失的相对权重。 - use_focal_loss (
bool, optional, 默认为True) — 用于指示是否使用 Focal Loss 的参数。 - auxiliary_loss (
bool, optional, 默认为True) — 是否使用辅助解码损失(即每个解码器层处的损失)。 - focal_loss_alpha (
float, optional, 默认为 0.75) — 用于计算 Focal Loss 的 alpha 参数。 - focal_loss_gamma (
float, optional, 默认为 2.0) — 用于计算 Focal Loss 的 gamma 参数。 - weight_loss_vfl (
float, optional, 默认为 1.0) — 目标检测损失中 Varifocal Loss 的相对权重。 - weight_loss_bbox (
float, optional, 默认为 5.0) — 目标检测损失中 L1 边界框损失的相对权重。 - weight_loss_giou (
float, optional, 默认为 2.0) — 目标检测损失中广义 IoU 损失的相对权重。 - weight_loss_fgl (
float, optional, 默认为 0.15) — 目标检测损失中细粒度定位损失的相对权重。 - weight_loss_ddf (
float, optional, 默认为 1.5) — 目标检测损失中解耦蒸馏 Focal Loss 的相对权重。 - eos_coefficient (
float, optional, 默认为0.0001) — 目标检测损失中“无物体”(no-object)类别的相对分类权重。 - eval_idx (
int, optional, 默认为 -1) — 用于评估的解码器层索引。 - layer_scale (
float, optional, 默认为1.0) — 后续解码器层中隐藏维度的缩放因子。 - max_num_bins (
int, optional, 默认为 32) — 用于基于分布引导的边界框细化的最大箱数(bins)。 - reg_scale (
float, optional, 默认为 4.0) — 回归分布的缩放因子。 - depth_mult (
float, optional, 默认为 1.0) — RepNCSPELAN5 层中块数的乘数。 - top_prob_values (
int, optional, 默认为 4) — 每个角点分布中需要考虑的最高概率值的数量。 - lqe_hidden_dim (
int, optional, 默认为 64) — 位置质量估计器(LQE)网络的隐藏维度大小。 - lqe_layers (
int, optional, 默认为 2) — 位置质量估计器 MLP 中的层数。 - decoder_offset_scale (
float, optional, 默认为 0.5) — 可变形注意力(deformable attention)中使用的偏移缩放比例。 - decoder_method (
str, optional, 默认为"default") — 解码器使用的方法:"default"或"discrete"。 - up (
float, optional, 默认为 0.5) — 控制加权函数(Weighting Function)的上限。 - tie_word_embeddings (
bool, optional, 默认为True) — 是否根据模型的tied_weights_keys映射来绑定权重嵌入。 - weight_loss_mal (
float, optional, 默认为 1.0) — 目标检测损失中匹配辅助损失(Matching Auxiliary Loss)的相对权重。 - use_dense_one_to_one (
bool, optional, 默认为True) — 是否在解码器层间使用稠密的一对一匹配。 - mal_alpha (
float, optional) — 匹配辅助损失(MAL)的 Alpha 参数。如果为None,则使用focal_loss_alpha。 - encoder_fuse_op (
str, optional, 默认为"sum") — 编码器 FPN 中使用的融合操作。DEIMv2 使用"sum"而不是 D-FINE 中的"cat"。 - spatial_tuning_adapter_inplanes (
int, optional, 默认为 16) — STA 卷积主干(convolutional stem)的输入平面数量。 - encoder_type (
str, optional, 默认为"hybrid") — 要使用的编码器类型。"hybrid"使用包含 AIFI、FPN 和 PAN 的完整 HybridEncoder。"lite"为较小的变体(Atto, Femto, Pico)使用带有 GAP 融合的轻量级 LiteEncoder。 - use_gateway (
bool, optional, 默认为True) — 是否在解码器层中使用网关机制(交叉注意力门控)。当为False时,改用编码器注意力输出上的 RMSNorm。 - share_bbox_head (
bool, optional, 默认为False) — 是否在所有解码器层之间共享边界框预测头。 - encoder_has_trailing_conv (
bool, optional, defaults toTrue) — 编码器的 CSP 块在瓶颈路径后是否包含一个 3x3 的尾部卷积。对于 RepNCSPELAN4(由 HGNetV2 N 和 LiteEncoder 变体使用)为True。对于 RepNCSPELAN5(由 DINOv3 变体使用)为False。
这是用于存储 Deimv2Model 配置的配置类。它根据指定的参数实例化 Deimv2 模型,从而定义模型架构。使用默认值实例化配置将产生与 Intellindust/DEIMv2_HGNetv2_N_COCO 类似的配置。
配置对象继承自 PreTrainedConfig,可用于控制模型输出。阅读 PreTrainedConfig 的文档以获取更多信息。
Deimv2Model
class transformers.Deimv2Model
< 源码 >( config: Deimv2Config )
参数
- config (Deimv2Config) — 具有模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。
RT-DETR 模型(由主干网络和编码器-解码器组成),输出原始的隐藏状态,顶部没有任何 head。
该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。
此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。
forward
< 源码 >( pixel_values: FloatTensor pixel_mask: torch.LongTensor | None = None encoder_outputs: torch.FloatTensor | None = None inputs_embeds: torch.FloatTensor | None = None labels: list[dict] | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) → Deimv2ModelOutput 或 tuple(torch.FloatTensor)
参数
- pixel_values (形状为
(batch_size, num_channels, image_size, image_size)的torch.FloatTensor) — 对应于输入图像的张量。像素值可以使用image_processor_class获取。有关详细信息,请参阅image_processor_class.__call__(processor_class使用image_processor_class进行图像处理)。 - pixel_mask (形状为
(batch_size, height, width)的torch.LongTensor,可选) — 用于避免对填充像素值执行注意力机制的掩码。掩码值在[0, 1]中选择:- 1 表示真实的像素(即未被掩码),
- 0 表示填充像素(即被掩码)。
- encoder_outputs (
torch.FloatTensor,可选) — 元组包含 (last_hidden_state, 可选:hidden_states, 可选:attentions),其中形状为(batch_size, sequence_length, hidden_size)的last_hidden_state(可选)是编码器最后一层输出的隐藏状态序列。用于解码器的交叉注意力机制中。 - inputs_embeds (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor,可选) — 可选地,你可以选择直接传入图像的扁平化表示,而不是传入扁平化的特征图(主干网络 + 投影层的输出)。 - labels (长度为
(batch_size,)的list[Dict],可选) — 用于计算二分匹配损失的标签。这是一个字典列表,每个字典至少包含以下两个键:‘class_labels’ 和 ‘boxes’(分别是批次中图像的类别标签和边界框)。类别标签本身应该是一个长度为(图像中边界框数量,)的torch.LongTensor,而框应该是形状为(图像中边界框数量, 4)的torch.FloatTensor。
返回
Deimv2ModelOutput 或 tuple(torch.FloatTensor)
一个 Deimv2ModelOutput 或一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置(None)和输入包含各种元素。
Deimv2Model 的前向传播(forward)方法,重写了 __call__ 特殊方法。
虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用
Module实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。
last_hidden_state (
torch.FloatTensor, 形状为(batch_size, num_queries, hidden_size)) — 模型解码器最后一层输出的隐藏状态序列。intermediate_hidden_states (
torch.FloatTensor, 形状为(batch_size, config.decoder_layers, num_queries, hidden_size)) — 堆叠的中间隐藏状态(解码器每层的输出)。intermediate_logits (
torch.FloatTensor,形状为(batch_size, config.decoder_layers, sequence_length, config.num_labels)) — 堆叠的中间 logits(解码器每一层的 logits)。intermediate_reference_points (
torch.FloatTensor, 形状为(batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间参考点(解码器每层的参考点)。intermediate_predicted_corners (
torch.FloatTensor,形状为(batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间预测角点(解码器每一层的预测角点)。initial_reference_points (
torch.FloatTensor,形状为(batch_size, num_queries, 4)) — 用于第一个解码器层的初始参考点。decoder_hidden_states (
tuple[torch.FloatTensor], 可选, 当传递output_hidden_states=True或当config.output_hidden_states=True时返回) —torch.FloatTensor元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为(batch_size, sequence_length, hidden_size)。解码器在每一层输出时的隐藏状态以及初始嵌入输出。
decoder_attentions (
tuple[torch.FloatTensor], 可选, 当传递output_attentions=True或当config.output_attentions=True时返回) —torch.FloatTensor元组(每一层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。
cross_attentions (
tuple[torch.FloatTensor], 可选,当传入output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。
encoder_last_hidden_state (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor, 可选, 默认为None) — 模型编码器最后一层输出的隐状态序列。encoder_hidden_states (
tuple[torch.FloatTensor], 可选, 当传递output_hidden_states=True或当config.output_hidden_states=True时返回) —torch.FloatTensor元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为(batch_size, sequence_length, hidden_size)。编码器在每一层输出时的隐藏状态以及初始嵌入输出。
encoder_attentions (
tuple[torch.FloatTensor], 可选, 当传递output_attentions=True或当config.output_attentions=True时返回) —torch.FloatTensor元组(每一层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。编码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。
init_reference_points (
torch.FloatTensor, 形状为(batch_size, num_queries, 4)) — 通过 Transformer 解码器发送的初始参考点。enc_topk_logits (
torch.FloatTensorof shape(batch_size, sequence_length, config.num_labels)) — 在编码器阶段中,预测的边界框分数,其中得分最高的config.two_stage_num_proposals个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。enc_topk_bboxes (
torch.FloatTensor,形状为(batch_size, sequence_length, 4)) — 编码器阶段预测的边界框坐标的 logits。enc_outputs_class (
torch.FloatTensorof shape(batch_size, sequence_length, config.num_labels), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 在第一阶段中,预测的边界框分数,其中得分最高的config.two_stage_num_proposals个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。enc_outputs_coord_logits (
torch.FloatTensorof shape(batch_size, sequence_length, 4), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 第一阶段中预测边界框坐标的对数。denoising_meta_values (
dict,可选,默认为None) — 用于去噪相关值的额外字典。
示例
>>> from transformers import AutoImageProcessor, Deimv2Model
>>> from PIL import Image
>>> import httpx
>>> from io import BytesIO
>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> with httpx.stream("GET", url) as response:
... image = Image.open(BytesIO(response.read()))
>>> image_processor = AutoImageProcessor.from_pretrained("PekingU/Deimv2_r50vd")
>>> model = Deimv2Model.from_pretrained("PekingU/Deimv2_r50vd")
>>> inputs = image_processor(images=image, return_tensors="pt")
>>> outputs = model(**inputs)
>>> last_hidden_states = outputs.last_hidden_state
>>> list(last_hidden_states.shape)
[1, 300, 256]Deimv2ForObjectDetection
class transformers.Deimv2ForObjectDetection
< 源码 >( config: Deimv2Config )
参数
- config (Deimv2Config) — 具有模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。
RT-DETR 模型(由主干网络和编码器-解码器组成),输出边界框和 logits,以便进一步解码为分数和类别。
该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。
此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。
forward
< 源码 >( pixel_values: FloatTensor pixel_mask: torch.LongTensor | None = None encoder_outputs: torch.FloatTensor | None = None inputs_embeds: torch.FloatTensor | None = None labels: list[dict] | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) → Deimv2ObjectDetectionOutput 或 tuple(torch.FloatTensor)
参数
- pixel_values (形状为
(batch_size, num_channels, image_size, image_size)的torch.FloatTensor) — 对应于输入图像的张量。像素值可以使用image_processor_class获取。有关详细信息,请参阅image_processor_class.__call__(processor_class使用image_processor_class进行图像处理)。 - pixel_mask (形状为
(batch_size, height, width)的torch.LongTensor,可选) — 用于避免对填充像素值执行注意力机制的掩码。掩码值在[0, 1]中选择:- 1 表示真实的像素(即未被掩码),
- 0 表示填充像素(即被掩码)。
- encoder_outputs (
torch.FloatTensor,可选) — 元组包含 (last_hidden_state, 可选:hidden_states, 可选:attentions),其中形状为(batch_size, sequence_length, hidden_size)的last_hidden_state(可选)是编码器最后一层输出的隐藏状态序列。用于解码器的交叉注意力机制中。 - inputs_embeds (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor,可选) — 可选地,你可以选择直接传入嵌入表示,而不是传入input_ids。如果你想比模型内部的嵌入查找矩阵更精细地控制如何将input_ids索引转换为关联向量,这会很有用。 - labels (形状为
(batch_size, sequence_length)的list[dict],可选) — 用于计算掩码语言模型损失的标签。索引应该在[0, ..., config.vocab_size]之间或为 -100(参见input_ids文档字符串)。索引设置为-100的标记将被忽略(掩码),损失仅针对标签在[0, ..., config.vocab_size]中的标记计算。
返回
Deimv2ObjectDetectionOutput 或 tuple(torch.FloatTensor)
一个 Deimv2ObjectDetectionOutput 或一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置(None)和输入包含各种元素。
Deimv2ForObjectDetection 的前向传播(forward)方法,重写了 __call__ 特殊方法。
虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用
Module实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。
loss (
torch.FloatTensorof shape(1,), optional, 当提供labels时返回)) — 总损失,是类别预测的负对数似然(交叉熵)和边界框损失的线性组合。后者定义为 L1 损失和广义尺度不变 IoU 损失的线性组合。loss_dict (
Dict, 可选) — 包含各个损失的字典。用于日志记录。logits (形状为
(batch_size, num_queries, num_classes + 1)的torch.FloatTensor) — 所有查询的分类 logits(包括无对象)。pred_boxes (形状为
(batch_size, num_queries, 4)的torch.FloatTensor) — 所有查询的归一化框坐标,表示为 (center_x, center_y, width, height)。这些值在 [0, 1] 之间归一化,相对于批次中每个图像的大小(忽略可能的填充)。你可以使用~Deimv2ImageProcessor.post_process_object_detection来获取未归一化的(绝对)边界框。auxiliary_outputs (
list[Dict], optional) — 可选,仅在启用了辅助损失(即config.auxiliary_loss设置为True)且提供了标签时返回。它是一个字典列表,包含每个解码器层的上述两个键(logits和pred_boxes)。last_hidden_state (
torch.FloatTensor, 形状为(batch_size, num_queries, hidden_size)) — 模型解码器最后一层输出的隐藏状态序列。intermediate_hidden_states (
torch.FloatTensor, 形状为(batch_size, config.decoder_layers, num_queries, hidden_size)) — 堆叠的中间隐藏状态(解码器每层的输出)。intermediate_logits (
torch.FloatTensor,形状为(batch_size, config.decoder_layers, num_queries, config.num_labels)) — 堆叠的中间 logits(解码器每一层的 logits)。intermediate_reference_points (
torch.FloatTensor, 形状为(batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间参考点(解码器每层的参考点)。intermediate_predicted_corners (
torch.FloatTensor,形状为(batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间预测角点(解码器每一层的预测角点)。initial_reference_points (
torch.FloatTensor,形状为(batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的初始参考点(解码器每一层的初始参考点)。decoder_hidden_states (
tuple[torch.FloatTensor], 可选, 当传递output_hidden_states=True或当config.output_hidden_states=True时返回) —torch.FloatTensor元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为(batch_size, sequence_length, hidden_size)。解码器在每一层输出时的隐藏状态以及初始嵌入输出。
decoder_attentions (
tuple[torch.FloatTensor], 可选, 当传递output_attentions=True或当config.output_attentions=True时返回) —torch.FloatTensor元组(每一层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。
cross_attentions (
tuple[torch.FloatTensor], 可选,当传入output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。
encoder_last_hidden_state (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor, 可选, 默认为None) — 模型编码器最后一层输出的隐状态序列。encoder_hidden_states (
tuple[torch.FloatTensor], 可选, 当传递output_hidden_states=True或当config.output_hidden_states=True时返回) —torch.FloatTensor元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为(batch_size, sequence_length, hidden_size)。编码器在每一层输出时的隐藏状态以及初始嵌入输出。
encoder_attentions (
tuple[torch.FloatTensor], 可选, 当传递output_attentions=True或当config.output_attentions=True时返回) —torch.FloatTensor元组(每一层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。编码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。
init_reference_points (
torch.FloatTensor, 形状为(batch_size, num_queries, 4)) — 通过 Transformer 解码器发送的初始参考点。enc_topk_logits (
torch.FloatTensorof shape(batch_size, sequence_length, config.num_labels), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 编码器中预测边界框坐标的对数几率。enc_topk_bboxes (
torch.FloatTensorof shape(batch_size, sequence_length, 4), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 编码器中预测边界框坐标的对数几率。enc_outputs_class (
torch.FloatTensorof shape(batch_size, sequence_length, config.num_labels), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 在第一阶段中,预测的边界框分数,其中得分最高的config.two_stage_num_proposals个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。enc_outputs_coord_logits (
torch.FloatTensorof shape(batch_size, sequence_length, 4), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 第一阶段中预测边界框坐标的对数。denoising_meta_values (
dict,*可选*,默认为None) — 用于去噪相关值的额外字典
示例
>>> import torch
>>> from transformers.image_utils import load_image
>>> from transformers import AutoImageProcessor, Deimv2ForObjectDetection
>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> image = load_image(url)
>>> image_processor = AutoImageProcessor.from_pretrained("harshaljanjani/DEIMv2_HGNetv2_N_COCO_Transformers")
>>> model = Deimv2ForObjectDetection.from_pretrained("harshaljanjani/DEIMv2_HGNetv2_N_COCO_Transformers")
>>> # prepare image for the model
>>> inputs = image_processor(images=image, return_tensors="pt")
>>> # forward pass
>>> outputs = model(**inputs)
>>> logits = outputs.logits
>>> list(logits.shape)
[1, 300, 80]
>>> boxes = outputs.pred_boxes
>>> list(boxes.shape)
[1, 300, 4]
>>> # convert outputs (bounding boxes and class logits) to Pascal VOC format (xmin, ymin, xmax, ymax)
>>> target_sizes = torch.tensor([image.size[::-1]])
>>> results = image_processor.post_process_object_detection(outputs, threshold=0.9, target_sizes=target_sizes)
>>> result = results[0] # first image in batch
>>> for score, label, box in zip(result["scores"], result["labels"], result["boxes"]):
... box = [round(i, 2) for i in box.tolist()]
... print(
... f"Detected {model.config.id2label[label.item()]} with confidence "
... f"{round(score.item(), 3)} at location {box}"
... )