Transformers 文档

LW-DETR

Hugging Face's logo
加入 Hugging Face 社区

并获得增强的文档体验

开始使用

该模型于 2024 年 7 月 24 日在 HF 论文中发布,并于 2026 年 1 月 12 日贡献给 Hugging Face Transformers。

LW-DETR

LW-DETR 提出了一种轻量级的 Detection Transformer (DETR) 架构,旨在与主流的 YOLO 系列竞争并超越其在实时目标检测方面的表现。通过结合 Transformer 的最新进展与高效的设计选择,它在速度(延迟)和精度(mAP)之间实现了全新的最先进(SOTA)平衡。

LW-DETR 架构的特点是其简单而高效的结构:一个普通的 ViT 编码器、一个投影器(Projector)以及一个浅层的 DETR 解码器。它通过以下核心修改增强了 DETR 架构的效率和速度:

  1. 高效的 ViT 编码器:使用带有交错窗口/全局注意力机制的普通 ViT,并采用窗口优先(window-major)组织方式,以大幅降低注意力复杂度和延迟。
  2. 更丰富的输入:聚合来自编码器的多级特征,并使用 C2f 投影器(YOLOv8)传递双尺度特征($1/8$ 和 $1/32$)。
  3. 更快的解码器:采用具有可变形交叉注意力(deformable cross-attention)的浅层 3 层 DETR 解码器,以实现更低的延迟和更快的收敛速度。
  4. 优化的查询(Queries):使用结合了可学习内容查询和生成空间查询的混合查询方案。

你可以在 AnnaZhang 组织下找到所有可用的 LW-DETR 检查点。原始代码可在此找到。

该模型由 stevenbucaille 贡献。

点击右侧侧边栏中的 LW-DETR 模型,查看更多关于如何将 LW-DETR 应用于不同目标检测任务的示例。

下面的示例演示了如何使用 PipelineAutoModel 类执行目标检测。

流水线
自动模型

from transformers import pipeline


pipeline = pipeline(
    "object-detection",
    model="AnnaZhang/lwdetr_small_60e_coco",
    device_map=0
)

pipeline("http://images.cocodataset.org/val2017/000000039769.jpg")

资源

这是一份官方 Hugging Face 和社区(由 🌎 标识)资源列表,旨在帮助你入门 LwDetr。

物体检测

LwDetrConfig

class transformers.LwDetrConfig

< >

( transformers_version: str | None = None architectures: list[str] | None = None output_hidden_states: bool | None = False return_dict: bool | None = True dtype: typing.Union[str, ForwardRef('torch.dtype'), NoneType] = None chunk_size_feed_forward: int = 0 is_encoder_decoder: bool = False id2label: dict[int, str] | dict[str, str] | None = None label2id: dict[str, int] | dict[str, str] | None = None problem_type: typing.Optional[typing.Literal['regression', 'single_label_classification', 'multi_label_classification']] = None backbone_config: dict | transformers.configuration_utils.PreTrainedConfig | None = None projector_scale_factors: list[float] | tuple[float, ...] = () hidden_expansion: float = 0.5 c2f_num_blocks: int = 3 activation_function: str = 'silu' batch_norm_eps: float = 1e-05 dropout: float | int = 0.0 decoder_ffn_dim: int = 2048 decoder_n_points: int = 4 decoder_layers: int = 3 decoder_self_attention_heads: int = 8 decoder_cross_attention_heads: int = 16 decoder_activation_function: str = 'relu' num_queries: int = 300 attention_bias: bool = True attention_dropout: float | int = 0.0 activation_dropout: float | int = 0.0 group_detr: int = 13 init_std: float = 0.02 disable_custom_kernels: bool = True class_cost: int | float = 2 bbox_cost: int | float = 5 giou_cost: int | float = 2 class_loss_coefficient: int | float = 1 dice_loss_coefficient: int | float = 1 bbox_loss_coefficient: int | float = 5 giou_loss_coefficient: int | float = 2 eos_coefficient: float = 0.1 focal_alpha: float = 0.25 auxiliary_loss: bool = True d_model: int = 256 )

参数

  • backbone_config (Union[dict, ~configuration_utils.PreTrainedConfig], 可选) — 主干模型的配置。
  • projector_scale_factors (list[float], 可选, 默认为 []) — 特征金字塔网络的缩放因子。每个缩放因子决定了不同层级特征的分辨率。支持的值为 0.5, 1.0 和 2.0。
  • hidden_expansion (float, 可选, 默认为 0.5) — 投影层中隐藏维度的扩展因子。
  • c2f_num_blocks (int, 可选, 默认为 3) — C2F 层中的块数。
  • activation_function (str, 可选, 默认为 "silu") — 投影器中的非线性激活函数。支持的值为 "silu", "relu", "gelu"
  • batch_norm_eps (float, 可选, 默认为 1e-05) — 批归一化层的 epsilon 值。
  • dropout (Union[float, int], 可选, 默认为 0.0) — 所有 dropout 层的比率。
  • decoder_ffn_dim (int, 可选, 默认为 2048) — 解码器中“中间”(通常称为前馈)层的维度。
  • decoder_n_points (int, 可选, 默认为 4) — 解码器中每个注意力头在每个特征层级中采样的键数。
  • decoder_layers (int, 可选, 默认为 3) — Transformer 解码器中的隐藏层数。如果未设置,将使用与 num_layers 相同的值。
  • decoder_self_attention_heads (int, 可选, 默认为 8) — 解码器自注意力中每个注意力层的注意力头数。
  • decoder_cross_attention_heads (int, 可选, 默认为 16) — 解码器交叉注意力中每个注意力层的注意力头数。
  • decoder_activation_function (str, 可选, 默认为 "relu") — 解码器中的非线性激活函数。支持的值为 "relu", "silu", "gelu"
  • num_queries (int, 可选, 默认为 300) — 对象查询的数量,即检测槽位。这是 LwDetrModel 在单张图像中可以检测到的最大对象数量。
  • attention_bias (bool, 可选, 默认为 True) — 是否在自注意力期间的查询、键、值和输出投影层中使用偏置。
  • attention_dropout (Union[float, int], 可选, 默认为 0.0) — 注意力概率的 dropout 比率。
  • activation_dropout (Union[float, int], optional, defaults to 0.0) — 全连接层内部激活函数的 dropout 比率。
  • group_detr (int, optional, defaults to 13) — Group DETR 注意力机制的组数,有助于降低计算复杂度。
  • init_std (float, optional, defaults to 0.02) — 用于初始化所有权重矩阵的 truncated_normal_initializer 的标准差。
  • disable_custom_kernels (bool, optional, defaults to True) — 禁用自定义 CUDA 和 CPU 内核。此选项对于 ONNX 导出是必需的,因为 PyTorch ONNX 导出不支持自定义内核。
  • class_cost (Union[int, float], optional, defaults to 2) — 匈牙利匹配代价中分类误差的相对权重。
  • bbox_cost (Union[int, float], optional, defaults to 5) — 匈牙利匹配代价中 L1 边界框误差的相对权重。
  • giou_cost (Union[int, float], optional, defaults to 2) — 匈牙利匹配代价中通用 IoU (generalized IoU) 损失的相对权重。
  • class_loss_coefficient (float, optional, defaults to 1) — 匈牙利匹配代价中分类损失的相对权重。
  • dice_loss_coefficient (Union[int, float], optional, defaults to 1) — 全景分割损失中 Dice 损失的相对权重。
  • bbox_loss_coefficient (Union[int, float], optional, defaults to 5) — 全景分割损失中 L1 边界框损失的相对权重。
  • giou_loss_coefficient (Union[int, float], optional, defaults to 2) — 全景分割损失中通用 IoU (generalized IoU) 损失的相对权重。
  • eos_coefficient (float, optional, defaults to 0.1) — 目标检测损失中“无目标”类别的相对分类权重。
  • focal_alpha (float, optional, defaults to 0.25) — Focal Loss 中的 Alpha 参数。
  • auxiliary_loss (bool, optional, defaults to True) — 是否使用辅助解码损失(即每层解码器层的损失)。
  • d_model (int, optional, defaults to 256) — 编码器层和池化层的维度大小。

这是用于存储 LwDetrModel 配置的配置类。它根据指定的参数实例化一个 Lw Detr 模型,从而定义模型架构。使用默认值实例化配置将产生与 AnnaZhang/lwdetr_small_60e_coco 类似的配置。

配置对象继承自 PreTrainedConfig,可用于控制模型输出。阅读 PreTrainedConfig 的文档以获取更多信息。

示例

>>> from transformers import LwDetrConfig, LwDetrModel

>>> # Initializing a LW-DETR AnnaZhang/lwdetr_small_60e_coco style configuration
>>> configuration = LwDetrConfig()

>>> # Initializing a model (with random weights) from the AnnaZhang/lwdetr_small_60e_coco style configuration
>>> model = LwDetrModel(configuration)

>>> # Accessing the model configuration
>>> configuration = model.config

LwDetrViTConfig

class transformers.LwDetrViTConfig

< >

( transformers_version: str | None = None architectures: list[str] | None = None output_hidden_states: bool | None = False return_dict: bool | None = True dtype: typing.Union[str, ForwardRef('torch.dtype'), NoneType] = None chunk_size_feed_forward: int = 0 is_encoder_decoder: bool = False id2label: dict[int, str] | dict[str, str] | None = None label2id: dict[str, int] | dict[str, str] | None = None problem_type: typing.Optional[typing.Literal['regression', 'single_label_classification', 'multi_label_classification']] = None hidden_size: int = 768 num_hidden_layers: int = 12 num_attention_heads: int = 12 mlp_ratio: int = 4 hidden_act: str = 'gelu' dropout_prob: float | int = 0.0 initializer_range: float = 0.02 layer_norm_eps: float = 1e-06 image_size: int | list[int] | tuple[int, int] = 256 pretrain_image_size: int | list[int] | tuple[int, int] = 224 patch_size: int | list[int] | tuple[int, int] = 16 num_channels: int = 3 qkv_bias: bool = True window_block_indices: list[int] | tuple[int, ...] = () use_absolute_position_embeddings: bool = True _out_features: list[str] | None = None _out_indices: list[int] | None = None cae_init_values: float = 0.1 num_windows: int = 16 )

参数

  • hidden_size (int, optional, defaults to 768) — 隐藏表示的维度。
  • num_hidden_layers (int, optional, defaults to 12) — Transformer 解码器中的隐藏层数量。
  • num_attention_heads (int, optional, defaults to 12) — Transformer 解码器中每个注意力层的注意力头数量。
  • mlp_ratio (int, optional, defaults to 4) — MLP 隐藏维度与嵌入维度的比率。
  • hidden_act (str, optional, defaults to gelu) — 解码器中的非线性激活函数(函数或字符串)。例如:"gelu", "relu", "silu" 等。
  • dropout_prob (Union[float, int], optional, defaults to 0.0) — 所有 dropout 层的比率。
  • initializer_range (float, optional, defaults to 0.02) — 用于初始化所有权重矩阵的 truncated_normal_initializer 的标准差。
  • layer_norm_eps (float, optional, defaults to 1e-06) — 层归一化层使用的 epsilon 值。
  • image_size (Union[int, list[int], tuple[int, int]], optional, defaults to 256) — 每张图像的大小(分辨率)。
  • pretrain_image_size (int, optional, defaults to 224) — 预训练期间每张图像的大小(分辨率)。
  • patch_size (Union[int, list[int], tuple[int, int]], optional, defaults to 16) — 每个补丁 (patch) 的大小(分辨率)。
  • num_channels (int, optional, 默认为 3) — 输入通道的数量。
  • qkv_bias (bool, optional, 默认为 True) — 是否为查询 (queries)、键 (keys) 和值 (values) 添加偏置。
  • window_block_indices (list[int], optional, 默认为 []) — 应该使用窗口注意力而非常规全局自注意力的块索引列表。
  • use_absolute_position_embeddings (bool, optional, 默认为 True) — 是否在分块嵌入 (patch embeddings) 中添加绝对位置嵌入。
  • cae_init_values (float, optional, 默认为 0.1) — 启用 use_cae 时,CAE 参数的初始化值。
  • num_windows (int, optional, 默认为 16) — 基于窗口的注意力的窗口数量。必须是完全平方数,且图像大小必须能被该值的平方根整除。这可以实现高效的窗口主序特征图组织。

这是用于存储 LwDetrModel 配置的配置类。它根据指定的参数实例化一个 Lw Detr 模型,从而定义模型架构。使用默认值实例化配置将产生与 AnnaZhang/lwdetr_small_60e_coco 类似的配置。

配置对象继承自 PreTrainedConfig,可用于控制模型输出。阅读 PreTrainedConfig 的文档以获取更多信息。

示例

>>> from transformers import LwDetrViTConfig, LwDetrViTModel

>>> # Initializing a LW-DETR ViT configuration
>>> configuration = LwDetrViTConfig()

>>> # Initializing a model (with random weights) from the configuration
>>> model = LwDetrViTModel(configuration)

>>> # Accessing the model configuration
>>> configuration = model.config

LwDetrModel

class transformers.LwDetrModel

< >

( config: LwDetrConfig )

参数

  • config (LwDetrConfig) — 包含模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。

纯净的 LW Detr 模型(由骨干网络和 Transformer 解码器组成),输出原始隐藏状态,顶部没有任何特定的检测头。

该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。

此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。

forward

< >

( pixel_values: FloatTensor = None pixel_mask: torch.LongTensor | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) LwDetrModelOutputtuple(torch.FloatTensor)

参数

  • pixel_values (torch.FloatTensor,形状为 (batch_size, num_channels, image_size, image_size)可选) — 对应于输入图像的张量。像素值可以使用 DeformableDetrImageProcessor 获取。详细信息请参阅 DeformableDetrImageProcessor.__call__() (processor_class 使用 DeformableDetrImageProcessor 处理图像)。
  • pixel_mask (torch.LongTensor,形状为 (batch_size, height, width)可选) — 用于避免对填充像素值进行注意力计算的掩码。掩码值在 [0, 1] 中选择:

    • 1 表示真实像素(即未被掩码),
    • 0 表示填充像素(即被掩码)。

    什么是注意力掩码?

返回

LwDetrModelOutputtuple(torch.FloatTensor)

一个 LwDetrModelOutput 或一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置 (LwDetrConfig) 和输入包含不同的元素。

LwDetrModel 的前向传播方法,覆盖了 __call__ 特殊方法。

虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用 Module 实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。

  • init_reference_points (torch.FloatTensor, 形状为 (batch_size, num_queries, 4)) — 通过 Transformer 解码器发送的初始参考点。

  • last_hidden_state (形状为 (batch_size, sequence_length, hidden_size)torch.FloatTensor, 可选,默认为 None) — 模型最后一层输出的隐藏状态序列。

  • intermediate_hidden_states (torch.FloatTensor, 形状为 (batch_size, config.decoder_layers, num_queries, hidden_size)) — 堆叠的中间隐藏状态(解码器每层的输出)。

  • intermediate_reference_points (torch.FloatTensor, 形状为 (batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间参考点(解码器每层的参考点)。

  • enc_outputs_class (torch.FloatTensor of shape (batch_size, sequence_length, config.num_labels), optional, returned when config.with_box_refine=True and config.two_stage=True) — 在第一阶段中,预测的边界框分数,其中得分最高的 config.two_stage_num_proposals 个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。

  • enc_outputs_coord_logits (torch.FloatTensor of shape (batch_size, sequence_length, 4), optional, returned when config.with_box_refine=True and config.two_stage=True) — 第一阶段中预测边界框坐标的对数。

  • hidden_states (tuple[torch.FloatTensor, ...]可选,当传递 output_hidden_states=Trueconfig.output_hidden_states=True 时返回) — torch.FloatTensor 的元组(如果模型有嵌入层,则第一个为嵌入输出,其余为每一层的输出),形状为 (batch_size, sequence_length, hidden_size)

    模型在每个层输出的隐藏状态以及可选的初始嵌入输出。

  • attentions (tuple[torch.FloatTensor, ...]可选,当传递 output_attentions=Trueconfig.output_attentions=True 时返回) — torch.FloatTensor 的元组(每层一个),形状为 (batch_size, num_heads, sequence_length, sequence_length)

    注意力 softmax 后的注意力权重,用于计算自注意力头中的加权平均值。

  • cross_attentions (tuple[torch.FloatTensor, ...], optional, 当传入 output_attentions=Trueconfig.output_attentions=True 时返回) — torch.FloatTensor 元组(每层一个),形状为 (batch_size, num_heads, sequence_length, sequence_length)

    解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。

示例

>>> from transformers import AutoImageProcessor, DeformableDetrModel
>>> from PIL import Image
>>> import httpx
>>> from io import BytesIO

>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> with httpx.stream("GET", url) as response:
...     image = Image.open(BytesIO(response.read()))

>>> image_processor = AutoImageProcessor.from_pretrained("AnnaZhang/lwdetr_small_60e_coco")
>>> model = DeformableDetrModel.from_pretrained("AnnaZhang/lwdetr_small_60e_coco")

>>> inputs = image_processor(images=image, return_tensors="pt")

>>> outputs = model(**inputs)

>>> last_hidden_states = outputs.last_hidden_state
>>> list(last_hidden_states.shape)
[1, 300, 256]

LwDetrForObjectDetection

class transformers.LwDetrForObjectDetection

< >

( config: LwDetrConfig )

参数

  • config (LwDetrConfig) — 包含模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。

LW DETR 模型(由骨干网络和 Transformer 解码器组成),顶部带有用于对象检测的头部,适用于 COCO 检测等任务。

该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。

此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。

forward

< >

( pixel_values: FloatTensor = None pixel_mask: torch.LongTensor | None = None labels: list[dict] | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) LwDetrObjectDetectionOutputtuple(torch.FloatTensor)

参数

  • pixel_values (torch.FloatTensor,形状为 (batch_size, num_channels, image_size, image_size)可选) — 对应于输入图像的张量。像素值可以使用 DeformableDetrImageProcessor 获取。详细信息请参阅 DeformableDetrImageProcessor.__call__() (processor_class 使用 DeformableDetrImageProcessor 处理图像)。
  • pixel_mask (torch.LongTensor,形状为 (batch_size, height, width)可选) — 用于避免对填充像素值进行注意力计算的掩码。掩码值在 [0, 1] 中选择:

    • 1 表示真实像素(即未被掩码),
    • 0 表示填充像素(即被掩码)。

    什么是注意力掩码?

  • labels (list[Dict],长度为 (batch_size,)可选) — 用于计算二分匹配损失的标签。字典列表,每个字典至少包含以下两个键:‘class_labels’ 和 ‘boxes’(分别是批次中某张图像的类标签和边界框)。类标签本身应为长度为 (图像中边界框数量,)torch.LongTensor,边界框应为形状为 (图像中边界框数量, 4)torch.FloatTensor

返回

LwDetrObjectDetectionOutputtuple(torch.FloatTensor)

一个 LwDetrObjectDetectionOutput 或一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置 (LwDetrConfig) 和输入包含不同的元素。

LwDetrForObjectDetection 的前向传播方法,覆盖了 __call__ 特殊方法。

虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用 Module 实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。

  • loss (torch.FloatTensor of shape (1,), optional, 当提供labels时返回)) — 总损失,是类别预测的负对数似然(交叉熵)和边界框损失的线性组合。后者定义为 L1 损失和广义尺度不变 IoU 损失的线性组合。

  • loss_dict (Dict, 可选) — 包含各个损失的字典。用于日志记录。

  • logits (形状为 (batch_size, num_queries, num_classes + 1)torch.FloatTensor) — 所有查询的分类 logits(包括无对象)。

  • pred_boxes (torch.FloatTensor,形状为 (batch_size, num_queries, 4)) — 所有查询的归一化框坐标,表示为 (center_x, center_y, width, height)。这些值相对于批次中每张图像的大小(忽略可能的填充)归一化在 [0, 1] 范围内。您可以使用 ~DeformableDetrProcessor.post_process_object_detection 来检索非归一化的边界框。

  • auxiliary_outputs (list[Dict], optional) — 可选,仅在启用了辅助损失(即config.auxiliary_loss设置为True)且提供了标签时返回。它是一个字典列表,包含每个解码器层的上述两个键(logitspred_boxes)。

  • init_reference_points (torch.FloatTensor, 形状为 (batch_size, num_queries, 4)) — 通过 Transformer 解码器发送的初始参考点。

  • last_hidden_state (形状为 (batch_size, sequence_length, hidden_size)torch.FloatTensor, 可选,默认为 None) — 模型最后一层输出的隐藏状态序列。

  • intermediate_hidden_states (torch.FloatTensor, 形状为 (batch_size, config.decoder_layers, num_queries, hidden_size)) — 堆叠的中间隐藏状态(解码器每层的输出)。

  • intermediate_reference_points (torch.FloatTensor, 形状为 (batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间参考点(解码器每层的参考点)。

  • enc_outputs_class (torch.FloatTensor of shape (batch_size, sequence_length, config.num_labels), optional, returned when config.with_box_refine=True and config.two_stage=True) — 在第一阶段中,预测的边界框分数,其中得分最高的 config.two_stage_num_proposals 个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。

  • enc_outputs_coord_logits (torch.FloatTensor of shape (batch_size, sequence_length, 4), optional, returned when config.with_box_refine=True and config.two_stage=True) — 第一阶段中预测边界框坐标的对数。

  • hidden_states (tuple[torch.FloatTensor, ...]可选,当传递 output_hidden_states=Trueconfig.output_hidden_states=True 时返回) — torch.FloatTensor 的元组(如果模型有嵌入层,则第一个为嵌入输出,其余为每一层的输出),形状为 (batch_size, sequence_length, hidden_size)

    模型在每个层输出的隐藏状态以及可选的初始嵌入输出。

  • attentions (tuple[torch.FloatTensor, ...]可选,当传递 output_attentions=Trueconfig.output_attentions=True 时返回) — torch.FloatTensor 的元组(每层一个),形状为 (batch_size, num_heads, sequence_length, sequence_length)

    注意力 softmax 后的注意力权重,用于计算自注意力头中的加权平均值。

  • cross_attentions (tuple[torch.FloatTensor, ...], optional, 当传入 output_attentions=Trueconfig.output_attentions=True 时返回) — torch.FloatTensor 元组(每层一个),形状为 (batch_size, num_heads, sequence_length, sequence_length)

    解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。

示例

>>> from transformers import AutoImageProcessor, LwDetrForObjectDetection
>>> from PIL import Image
>>> import httpx
>>> from io import BytesIO

>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> with httpx.stream("GET", url) as response:
...     image = Image.open(BytesIO(response.read()))

>>> image_processor = AutoImageProcessor.from_pretrained("AnnaZhang/lwdetr_small_60e_coco")
>>> model = LwDetrForObjectDetection.from_pretrained("AnnaZhang/lwdetr_small_60e_coco")

>>> inputs = image_processor(images=image, return_tensors="pt")
>>> outputs = model(**inputs)

>>> # convert outputs (bounding boxes and class logits) to Pascal VOC format (xmin, ymin, xmax, ymax)
>>> target_sizes = torch.tensor([image.size[::-1]])
>>> results = image_processor.post_process_object_detection(outputs, threshold=0.5, target_sizes=target_sizes)[
...     0
... ]
>>> for score, label, box in zip(results["scores"], results["labels"], results["boxes"]):
...     box = [round(i, 2) for i in box.tolist()]
...     print(
...         f"Detected {model.config.id2label[label.item()]} with confidence "
...         f"{round(score.item(), 3)} at location {box}"
...     )
Detected cat with confidence 0.8 at location [16.5, 52.84, 318.25, 470.78]
Detected cat with confidence 0.789 at location [342.19, 24.3, 640.02, 372.25]
Detected remote with confidence 0.633 at location [40.79, 72.78, 176.76, 117.25]

LwDetrViTBackbone

class transformers.LwDetrViTBackbone

< >

( config model_args: ~utils.generic.ModelArgs | None = None adapter_args: ~utils.generic.AdapterArgs | None = None lora_args: ~utils.generic.LoRAArgs | None = None tokenizer_args: ~utils.generic.TokenizerArgs | None = None dataset_args: ~utils.generic.DatasetArgs | None = None data_args: ~utils.generic.DataArgs | None = None training_args: ~utils.generic.TrainingArgs | None = None generation_args: ~utils.generic.GenerationArgs | None = None vision_tower_args: ~utils.generic.VisionTowerArgs | None = None qlora_args: ~utils.generic.QLoRAArgs | None = None vision_tower_template_args: ~utils.generic.VisionTowerTemplateArgs | None = None video_tower_args: ~utils.generic.VideoTowerArgs | None = None vision_config: ~utils.generic.VisionConfig | None = None video_config: ~utils.generic.VideoConfig | None = None load_dataset: bool | None = None load_data_collator: bool | None = None load_processor: bool | None = None load_lora_adapter: bool | None = None load_adapter: bool | None = None load_qlora_adapter: bool | None = None **kwargs: typing_extensions.Unpack[transformers.modeling_utils.PreTrainedModelKwargs] )

参数

  • config (LwDetrViTBackbone) — 包含模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。

Lw Detr 骨干网络。

该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。

此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。

forward

< >

( pixel_values: Tensor **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) BackboneOutputtuple(torch.FloatTensor)

参数

  • pixel_values (torch.Tensor,形状为 (batch_size, num_channels, image_size, image_size)) — 对应于输入图像的张量。像素值可以使用 DeformableDetrImageProcessor 获取。详细信息请参阅 DeformableDetrImageProcessor.__call__() (processor_class 使用 DeformableDetrImageProcessor 处理图像)。

返回

BackboneOutputtuple(torch.FloatTensor)

一个 BackboneOutput 或一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置 (LwDetrConfig) 和输入包含不同的元素。

LwDetrViTBackbone 的前向传播方法,覆盖了 __call__ 特殊方法。

虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用 Module 实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。

  • feature_maps (tuple(torch.FloatTensor) of shape (batch_size, num_channels, height, width)) — 阶段的特征图。

  • hidden_states (tuple(torch.FloatTensor), optional, returned when output_hidden_states=True is passed or when config.output_hidden_states=True) — torch.FloatTensor 元组(一个用于嵌入输出 + 每个层输出一个)的形状为 (batch_size, sequence_length, hidden_size)(batch_size, num_channels, height, width),具体取决于主干网络。

    模型在每个阶段输出的隐藏状态以及初始嵌入输出。

  • attentions (tuple(torch.FloatTensor), optional, returned when output_attentions=True is passed or when config.output_attentions=True) — torch.FloatTensor 元组(每个层一个)的形状为 (batch_size, num_heads, sequence_length, sequence_length)。仅当主干网络使用注意力时适用。

    注意力 softmax 后的注意力权重,用于计算自注意力头中的加权平均值。

示例

>>> from transformers import LwDetrViTConfig, LwDetrViTBackbone
>>> import torch

>>> config = LwDetrViTConfig()
>>> model = LwDetrViTBackbone(config)

>>> pixel_values = torch.randn(1, 3, 224, 224)

>>> with torch.no_grad():
...     outputs = model(pixel_values)

>>> feature_maps = outputs.feature_maps
>>> list(feature_maps[-1].shape)
[1, 768, 14, 14]
在 GitHub 上更新

© . This site is unofficial and not affiliated with Hugging Face, Inc.