Transformers 文档
LW-DETR
并获得增强的文档体验
开始使用
该模型于 2024 年 7 月 24 日在 HF 论文中发布,并于 2026 年 1 月 12 日贡献给 Hugging Face Transformers。
LW-DETR
LW-DETR 提出了一种轻量级的 Detection Transformer (DETR) 架构,旨在与主流的 YOLO 系列竞争并超越其在实时目标检测方面的表现。通过结合 Transformer 的最新进展与高效的设计选择,它在速度(延迟)和精度(mAP)之间实现了全新的最先进(SOTA)平衡。
LW-DETR 架构的特点是其简单而高效的结构:一个普通的 ViT 编码器、一个投影器(Projector)以及一个浅层的 DETR 解码器。它通过以下核心修改增强了 DETR 架构的效率和速度:
- 高效的 ViT 编码器:使用带有交错窗口/全局注意力机制的普通 ViT,并采用窗口优先(window-major)组织方式,以大幅降低注意力复杂度和延迟。
- 更丰富的输入:聚合来自编码器的多级特征,并使用 C2f 投影器(YOLOv8)传递双尺度特征($1/8$ 和 $1/32$)。
- 更快的解码器:采用具有可变形交叉注意力(deformable cross-attention)的浅层 3 层 DETR 解码器,以实现更低的延迟和更快的收敛速度。
- 优化的查询(Queries):使用结合了可学习内容查询和生成空间查询的混合查询方案。
你可以在 AnnaZhang 组织下找到所有可用的 LW-DETR 检查点。原始代码可在此处找到。
该模型由 stevenbucaille 贡献。
点击右侧侧边栏中的 LW-DETR 模型,查看更多关于如何将 LW-DETR 应用于不同目标检测任务的示例。
下面的示例演示了如何使用 Pipeline 和 AutoModel 类执行目标检测。
from transformers import pipeline
pipeline = pipeline(
"object-detection",
model="AnnaZhang/lwdetr_small_60e_coco",
device_map=0
)
pipeline("http://images.cocodataset.org/val2017/000000039769.jpg")资源
这是一份官方 Hugging Face 和社区(由 🌎 标识)资源列表,旨在帮助你入门 LwDetr。
- 使用 Trainer 或 Accelerate 微调 LwDetrForObjectDetection 的脚本可以在此处找到。
- 另请参阅:目标检测任务指南。
LwDetrConfig
class transformers.LwDetrConfig
< 源代码 >( transformers_version: str | None = None architectures: list[str] | None = None output_hidden_states: bool | None = False return_dict: bool | None = True dtype: typing.Union[str, ForwardRef('torch.dtype'), NoneType] = None chunk_size_feed_forward: int = 0 is_encoder_decoder: bool = False id2label: dict[int, str] | dict[str, str] | None = None label2id: dict[str, int] | dict[str, str] | None = None problem_type: typing.Optional[typing.Literal['regression', 'single_label_classification', 'multi_label_classification']] = None backbone_config: dict | transformers.configuration_utils.PreTrainedConfig | None = None projector_scale_factors: list[float] | tuple[float, ...] = () hidden_expansion: float = 0.5 c2f_num_blocks: int = 3 activation_function: str = 'silu' batch_norm_eps: float = 1e-05 dropout: float | int = 0.0 decoder_ffn_dim: int = 2048 decoder_n_points: int = 4 decoder_layers: int = 3 decoder_self_attention_heads: int = 8 decoder_cross_attention_heads: int = 16 decoder_activation_function: str = 'relu' num_queries: int = 300 attention_bias: bool = True attention_dropout: float | int = 0.0 activation_dropout: float | int = 0.0 group_detr: int = 13 init_std: float = 0.02 disable_custom_kernels: bool = True class_cost: int | float = 2 bbox_cost: int | float = 5 giou_cost: int | float = 2 class_loss_coefficient: int | float = 1 dice_loss_coefficient: int | float = 1 bbox_loss_coefficient: int | float = 5 giou_loss_coefficient: int | float = 2 eos_coefficient: float = 0.1 focal_alpha: float = 0.25 auxiliary_loss: bool = True d_model: int = 256 )
参数
- backbone_config (
Union[dict, ~configuration_utils.PreTrainedConfig], 可选) — 主干模型的配置。 - projector_scale_factors (
list[float], 可选, 默认为[]) — 特征金字塔网络的缩放因子。每个缩放因子决定了不同层级特征的分辨率。支持的值为 0.5, 1.0 和 2.0。 - hidden_expansion (
float, 可选, 默认为 0.5) — 投影层中隐藏维度的扩展因子。 - c2f_num_blocks (
int, 可选, 默认为 3) — C2F 层中的块数。 - activation_function (
str, 可选, 默认为"silu") — 投影器中的非线性激活函数。支持的值为"silu","relu","gelu"。 - batch_norm_eps (
float, 可选, 默认为 1e-05) — 批归一化层的 epsilon 值。 - dropout (
Union[float, int], 可选, 默认为0.0) — 所有 dropout 层的比率。 - decoder_ffn_dim (
int, 可选, 默认为 2048) — 解码器中“中间”(通常称为前馈)层的维度。 - decoder_n_points (
int, 可选, 默认为 4) — 解码器中每个注意力头在每个特征层级中采样的键数。 - decoder_layers (
int, 可选, 默认为3) — Transformer 解码器中的隐藏层数。如果未设置,将使用与num_layers相同的值。 - decoder_self_attention_heads (
int, 可选, 默认为 8) — 解码器自注意力中每个注意力层的注意力头数。 - decoder_cross_attention_heads (
int, 可选, 默认为 16) — 解码器交叉注意力中每个注意力层的注意力头数。 - decoder_activation_function (
str, 可选, 默认为"relu") — 解码器中的非线性激活函数。支持的值为"relu","silu","gelu"。 - num_queries (
int, 可选, 默认为 300) — 对象查询的数量,即检测槽位。这是 LwDetrModel 在单张图像中可以检测到的最大对象数量。 - attention_bias (
bool, 可选, 默认为True) — 是否在自注意力期间的查询、键、值和输出投影层中使用偏置。 - attention_dropout (
Union[float, int], 可选, 默认为0.0) — 注意力概率的 dropout 比率。 - activation_dropout (
Union[float, int], optional, defaults to0.0) — 全连接层内部激活函数的 dropout 比率。 - group_detr (
int, optional, defaults to 13) — Group DETR 注意力机制的组数,有助于降低计算复杂度。 - init_std (
float, optional, defaults to0.02) — 用于初始化所有权重矩阵的 truncated_normal_initializer 的标准差。 - disable_custom_kernels (
bool, optional, defaults toTrue) — 禁用自定义 CUDA 和 CPU 内核。此选项对于 ONNX 导出是必需的,因为 PyTorch ONNX 导出不支持自定义内核。 - class_cost (
Union[int, float], optional, defaults to2) — 匈牙利匹配代价中分类误差的相对权重。 - bbox_cost (
Union[int, float], optional, defaults to5) — 匈牙利匹配代价中 L1 边界框误差的相对权重。 - giou_cost (
Union[int, float], optional, defaults to2) — 匈牙利匹配代价中通用 IoU (generalized IoU) 损失的相对权重。 - class_loss_coefficient (
float, optional, defaults to 1) — 匈牙利匹配代价中分类损失的相对权重。 - dice_loss_coefficient (
Union[int, float], optional, defaults to1) — 全景分割损失中 Dice 损失的相对权重。 - bbox_loss_coefficient (
Union[int, float], optional, defaults to5) — 全景分割损失中 L1 边界框损失的相对权重。 - giou_loss_coefficient (
Union[int, float], optional, defaults to2) — 全景分割损失中通用 IoU (generalized IoU) 损失的相对权重。 - eos_coefficient (
float, optional, defaults to0.1) — 目标检测损失中“无目标”类别的相对分类权重。 - focal_alpha (
float, optional, defaults to0.25) — Focal Loss 中的 Alpha 参数。 - auxiliary_loss (
bool, optional, defaults toTrue) — 是否使用辅助解码损失(即每层解码器层的损失)。 - d_model (
int, optional, defaults to256) — 编码器层和池化层的维度大小。
这是用于存储 LwDetrModel 配置的配置类。它根据指定的参数实例化一个 Lw Detr 模型,从而定义模型架构。使用默认值实例化配置将产生与 AnnaZhang/lwdetr_small_60e_coco 类似的配置。
配置对象继承自 PreTrainedConfig,可用于控制模型输出。阅读 PreTrainedConfig 的文档以获取更多信息。
示例
>>> from transformers import LwDetrConfig, LwDetrModel
>>> # Initializing a LW-DETR AnnaZhang/lwdetr_small_60e_coco style configuration
>>> configuration = LwDetrConfig()
>>> # Initializing a model (with random weights) from the AnnaZhang/lwdetr_small_60e_coco style configuration
>>> model = LwDetrModel(configuration)
>>> # Accessing the model configuration
>>> configuration = model.configLwDetrViTConfig
class transformers.LwDetrViTConfig
< source >( transformers_version: str | None = None architectures: list[str] | None = None output_hidden_states: bool | None = False return_dict: bool | None = True dtype: typing.Union[str, ForwardRef('torch.dtype'), NoneType] = None chunk_size_feed_forward: int = 0 is_encoder_decoder: bool = False id2label: dict[int, str] | dict[str, str] | None = None label2id: dict[str, int] | dict[str, str] | None = None problem_type: typing.Optional[typing.Literal['regression', 'single_label_classification', 'multi_label_classification']] = None hidden_size: int = 768 num_hidden_layers: int = 12 num_attention_heads: int = 12 mlp_ratio: int = 4 hidden_act: str = 'gelu' dropout_prob: float | int = 0.0 initializer_range: float = 0.02 layer_norm_eps: float = 1e-06 image_size: int | list[int] | tuple[int, int] = 256 pretrain_image_size: int | list[int] | tuple[int, int] = 224 patch_size: int | list[int] | tuple[int, int] = 16 num_channels: int = 3 qkv_bias: bool = True window_block_indices: list[int] | tuple[int, ...] = () use_absolute_position_embeddings: bool = True _out_features: list[str] | None = None _out_indices: list[int] | None = None cae_init_values: float = 0.1 num_windows: int = 16 )
参数
- hidden_size (
int, optional, defaults to768) — 隐藏表示的维度。 - num_hidden_layers (
int, optional, defaults to12) — Transformer 解码器中的隐藏层数量。 - num_attention_heads (
int, optional, defaults to12) — Transformer 解码器中每个注意力层的注意力头数量。 - mlp_ratio (
int, optional, defaults to4) — MLP 隐藏维度与嵌入维度的比率。 - hidden_act (
str, optional, defaults togelu) — 解码器中的非线性激活函数(函数或字符串)。例如:"gelu","relu","silu"等。 - dropout_prob (
Union[float, int], optional, defaults to0.0) — 所有 dropout 层的比率。 - initializer_range (
float, optional, defaults to0.02) — 用于初始化所有权重矩阵的 truncated_normal_initializer 的标准差。 - layer_norm_eps (
float, optional, defaults to1e-06) — 层归一化层使用的 epsilon 值。 - image_size (
Union[int, list[int], tuple[int, int]], optional, defaults to256) — 每张图像的大小(分辨率)。 - pretrain_image_size (
int, optional, defaults to 224) — 预训练期间每张图像的大小(分辨率)。 - patch_size (
Union[int, list[int], tuple[int, int]], optional, defaults to16) — 每个补丁 (patch) 的大小(分辨率)。 - num_channels (
int, optional, 默认为3) — 输入通道的数量。 - qkv_bias (
bool, optional, 默认为True) — 是否为查询 (queries)、键 (keys) 和值 (values) 添加偏置。 - window_block_indices (
list[int], optional, 默认为[]) — 应该使用窗口注意力而非常规全局自注意力的块索引列表。 - use_absolute_position_embeddings (
bool, optional, 默认为True) — 是否在分块嵌入 (patch embeddings) 中添加绝对位置嵌入。 - cae_init_values (
float, optional, 默认为 0.1) — 启用use_cae时,CAE 参数的初始化值。 - num_windows (
int, optional, 默认为 16) — 基于窗口的注意力的窗口数量。必须是完全平方数,且图像大小必须能被该值的平方根整除。这可以实现高效的窗口主序特征图组织。
这是用于存储 LwDetrModel 配置的配置类。它根据指定的参数实例化一个 Lw Detr 模型,从而定义模型架构。使用默认值实例化配置将产生与 AnnaZhang/lwdetr_small_60e_coco 类似的配置。
配置对象继承自 PreTrainedConfig,可用于控制模型输出。阅读 PreTrainedConfig 的文档以获取更多信息。
示例
>>> from transformers import LwDetrViTConfig, LwDetrViTModel
>>> # Initializing a LW-DETR ViT configuration
>>> configuration = LwDetrViTConfig()
>>> # Initializing a model (with random weights) from the configuration
>>> model = LwDetrViTModel(configuration)
>>> # Accessing the model configuration
>>> configuration = model.configLwDetrModel
class transformers.LwDetrModel
< 源文件 >( config: LwDetrConfig )
参数
- config (LwDetrConfig) — 包含模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。
纯净的 LW Detr 模型(由骨干网络和 Transformer 解码器组成),输出原始隐藏状态,顶部没有任何特定的检测头。
该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。
此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。
forward
< 源文件 >( pixel_values: FloatTensor = None pixel_mask: torch.LongTensor | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) → LwDetrModelOutput 或 tuple(torch.FloatTensor)
参数
- pixel_values (
torch.FloatTensor,形状为(batch_size, num_channels, image_size, image_size),可选) — 对应于输入图像的张量。像素值可以使用 DeformableDetrImageProcessor 获取。详细信息请参阅DeformableDetrImageProcessor.__call__()(processor_class使用 DeformableDetrImageProcessor 处理图像)。 - pixel_mask (
torch.LongTensor,形状为(batch_size, height, width),可选) — 用于避免对填充像素值进行注意力计算的掩码。掩码值在[0, 1]中选择:- 1 表示真实像素(即未被掩码),
- 0 表示填充像素(即被掩码)。
返回
LwDetrModelOutput 或 tuple(torch.FloatTensor)
一个 LwDetrModelOutput 或一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置 (LwDetrConfig) 和输入包含不同的元素。
LwDetrModel 的前向传播方法,覆盖了 __call__ 特殊方法。
虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用
Module实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。
init_reference_points (
torch.FloatTensor, 形状为(batch_size, num_queries, 4)) — 通过 Transformer 解码器发送的初始参考点。last_hidden_state (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor, 可选,默认为None) — 模型最后一层输出的隐藏状态序列。intermediate_hidden_states (
torch.FloatTensor, 形状为(batch_size, config.decoder_layers, num_queries, hidden_size)) — 堆叠的中间隐藏状态(解码器每层的输出)。intermediate_reference_points (
torch.FloatTensor, 形状为(batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间参考点(解码器每层的参考点)。enc_outputs_class (
torch.FloatTensorof shape(batch_size, sequence_length, config.num_labels), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 在第一阶段中,预测的边界框分数,其中得分最高的config.two_stage_num_proposals个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。enc_outputs_coord_logits (
torch.FloatTensorof shape(batch_size, sequence_length, 4), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 第一阶段中预测边界框坐标的对数。hidden_states (
tuple[torch.FloatTensor, ...],可选,当传递output_hidden_states=True或config.output_hidden_states=True时返回) —torch.FloatTensor的元组(如果模型有嵌入层,则第一个为嵌入输出,其余为每一层的输出),形状为(batch_size, sequence_length, hidden_size)。模型在每个层输出的隐藏状态以及可选的初始嵌入输出。
attentions (
tuple[torch.FloatTensor, ...],可选,当传递output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor的元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。注意力 softmax 后的注意力权重,用于计算自注意力头中的加权平均值。
cross_attentions (
tuple[torch.FloatTensor, ...], optional, 当传入output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。
示例
>>> from transformers import AutoImageProcessor, DeformableDetrModel
>>> from PIL import Image
>>> import httpx
>>> from io import BytesIO
>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> with httpx.stream("GET", url) as response:
... image = Image.open(BytesIO(response.read()))
>>> image_processor = AutoImageProcessor.from_pretrained("AnnaZhang/lwdetr_small_60e_coco")
>>> model = DeformableDetrModel.from_pretrained("AnnaZhang/lwdetr_small_60e_coco")
>>> inputs = image_processor(images=image, return_tensors="pt")
>>> outputs = model(**inputs)
>>> last_hidden_states = outputs.last_hidden_state
>>> list(last_hidden_states.shape)
[1, 300, 256]LwDetrForObjectDetection
class transformers.LwDetrForObjectDetection
< 源文件 >( config: LwDetrConfig )
参数
- config (LwDetrConfig) — 包含模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。
LW DETR 模型(由骨干网络和 Transformer 解码器组成),顶部带有用于对象检测的头部,适用于 COCO 检测等任务。
该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。
此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。
forward
< 源文件 >( pixel_values: FloatTensor = None pixel_mask: torch.LongTensor | None = None labels: list[dict] | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) → LwDetrObjectDetectionOutput 或 tuple(torch.FloatTensor)
参数
- pixel_values (
torch.FloatTensor,形状为(batch_size, num_channels, image_size, image_size),可选) — 对应于输入图像的张量。像素值可以使用 DeformableDetrImageProcessor 获取。详细信息请参阅DeformableDetrImageProcessor.__call__()(processor_class使用 DeformableDetrImageProcessor 处理图像)。 - pixel_mask (
torch.LongTensor,形状为(batch_size, height, width),可选) — 用于避免对填充像素值进行注意力计算的掩码。掩码值在[0, 1]中选择:- 1 表示真实像素(即未被掩码),
- 0 表示填充像素(即被掩码)。
- labels (
list[Dict],长度为(batch_size,),可选) — 用于计算二分匹配损失的标签。字典列表,每个字典至少包含以下两个键:‘class_labels’ 和 ‘boxes’(分别是批次中某张图像的类标签和边界框)。类标签本身应为长度为(图像中边界框数量,)的torch.LongTensor,边界框应为形状为(图像中边界框数量, 4)的torch.FloatTensor。
返回
LwDetrObjectDetectionOutput 或 tuple(torch.FloatTensor)
一个 LwDetrObjectDetectionOutput 或一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置 (LwDetrConfig) 和输入包含不同的元素。
LwDetrForObjectDetection 的前向传播方法,覆盖了 __call__ 特殊方法。
虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用
Module实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。
loss (
torch.FloatTensorof shape(1,), optional, 当提供labels时返回)) — 总损失,是类别预测的负对数似然(交叉熵)和边界框损失的线性组合。后者定义为 L1 损失和广义尺度不变 IoU 损失的线性组合。loss_dict (
Dict, 可选) — 包含各个损失的字典。用于日志记录。logits (形状为
(batch_size, num_queries, num_classes + 1)的torch.FloatTensor) — 所有查询的分类 logits(包括无对象)。pred_boxes (
torch.FloatTensor,形状为(batch_size, num_queries, 4)) — 所有查询的归一化框坐标,表示为 (center_x, center_y, width, height)。这些值相对于批次中每张图像的大小(忽略可能的填充)归一化在 [0, 1] 范围内。您可以使用~DeformableDetrProcessor.post_process_object_detection来检索非归一化的边界框。auxiliary_outputs (
list[Dict], optional) — 可选,仅在启用了辅助损失(即config.auxiliary_loss设置为True)且提供了标签时返回。它是一个字典列表,包含每个解码器层的上述两个键(logits和pred_boxes)。init_reference_points (
torch.FloatTensor, 形状为(batch_size, num_queries, 4)) — 通过 Transformer 解码器发送的初始参考点。last_hidden_state (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor, 可选,默认为None) — 模型最后一层输出的隐藏状态序列。intermediate_hidden_states (
torch.FloatTensor, 形状为(batch_size, config.decoder_layers, num_queries, hidden_size)) — 堆叠的中间隐藏状态(解码器每层的输出)。intermediate_reference_points (
torch.FloatTensor, 形状为(batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间参考点(解码器每层的参考点)。enc_outputs_class (
torch.FloatTensorof shape(batch_size, sequence_length, config.num_labels), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 在第一阶段中,预测的边界框分数,其中得分最高的config.two_stage_num_proposals个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。enc_outputs_coord_logits (
torch.FloatTensorof shape(batch_size, sequence_length, 4), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 第一阶段中预测边界框坐标的对数。hidden_states (
tuple[torch.FloatTensor, ...],可选,当传递output_hidden_states=True或config.output_hidden_states=True时返回) —torch.FloatTensor的元组(如果模型有嵌入层,则第一个为嵌入输出,其余为每一层的输出),形状为(batch_size, sequence_length, hidden_size)。模型在每个层输出的隐藏状态以及可选的初始嵌入输出。
attentions (
tuple[torch.FloatTensor, ...],可选,当传递output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor的元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。注意力 softmax 后的注意力权重,用于计算自注意力头中的加权平均值。
cross_attentions (
tuple[torch.FloatTensor, ...], optional, 当传入output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。
示例
>>> from transformers import AutoImageProcessor, LwDetrForObjectDetection
>>> from PIL import Image
>>> import httpx
>>> from io import BytesIO
>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> with httpx.stream("GET", url) as response:
... image = Image.open(BytesIO(response.read()))
>>> image_processor = AutoImageProcessor.from_pretrained("AnnaZhang/lwdetr_small_60e_coco")
>>> model = LwDetrForObjectDetection.from_pretrained("AnnaZhang/lwdetr_small_60e_coco")
>>> inputs = image_processor(images=image, return_tensors="pt")
>>> outputs = model(**inputs)
>>> # convert outputs (bounding boxes and class logits) to Pascal VOC format (xmin, ymin, xmax, ymax)
>>> target_sizes = torch.tensor([image.size[::-1]])
>>> results = image_processor.post_process_object_detection(outputs, threshold=0.5, target_sizes=target_sizes)[
... 0
... ]
>>> for score, label, box in zip(results["scores"], results["labels"], results["boxes"]):
... box = [round(i, 2) for i in box.tolist()]
... print(
... f"Detected {model.config.id2label[label.item()]} with confidence "
... f"{round(score.item(), 3)} at location {box}"
... )
Detected cat with confidence 0.8 at location [16.5, 52.84, 318.25, 470.78]
Detected cat with confidence 0.789 at location [342.19, 24.3, 640.02, 372.25]
Detected remote with confidence 0.633 at location [40.79, 72.78, 176.76, 117.25]LwDetrViTBackbone
class transformers.LwDetrViTBackbone
< 源文件 >( config model_args: ~utils.generic.ModelArgs | None = None adapter_args: ~utils.generic.AdapterArgs | None = None lora_args: ~utils.generic.LoRAArgs | None = None tokenizer_args: ~utils.generic.TokenizerArgs | None = None dataset_args: ~utils.generic.DatasetArgs | None = None data_args: ~utils.generic.DataArgs | None = None training_args: ~utils.generic.TrainingArgs | None = None generation_args: ~utils.generic.GenerationArgs | None = None vision_tower_args: ~utils.generic.VisionTowerArgs | None = None qlora_args: ~utils.generic.QLoRAArgs | None = None vision_tower_template_args: ~utils.generic.VisionTowerTemplateArgs | None = None video_tower_args: ~utils.generic.VideoTowerArgs | None = None vision_config: ~utils.generic.VisionConfig | None = None video_config: ~utils.generic.VideoConfig | None = None load_dataset: bool | None = None load_data_collator: bool | None = None load_processor: bool | None = None load_lora_adapter: bool | None = None load_adapter: bool | None = None load_qlora_adapter: bool | None = None **kwargs: typing_extensions.Unpack[transformers.modeling_utils.PreTrainedModelKwargs] )
参数
- config (LwDetrViTBackbone) — 包含模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。
Lw Detr 骨干网络。
该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。
此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。
forward
< 源文件 >( pixel_values: Tensor **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) → BackboneOutput 或 tuple(torch.FloatTensor)
参数
- pixel_values (
torch.Tensor,形状为(batch_size, num_channels, image_size, image_size)) — 对应于输入图像的张量。像素值可以使用 DeformableDetrImageProcessor 获取。详细信息请参阅DeformableDetrImageProcessor.__call__()(processor_class使用 DeformableDetrImageProcessor 处理图像)。
返回
BackboneOutput 或 tuple(torch.FloatTensor)
一个 BackboneOutput 或一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置 (LwDetrConfig) 和输入包含不同的元素。
LwDetrViTBackbone 的前向传播方法,覆盖了 __call__ 特殊方法。
虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用
Module实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。
feature_maps (
tuple(torch.FloatTensor)of shape(batch_size, num_channels, height, width)) — 阶段的特征图。hidden_states (
tuple(torch.FloatTensor), optional, returned whenoutput_hidden_states=Trueis passed or whenconfig.output_hidden_states=True) —torch.FloatTensor元组(一个用于嵌入输出 + 每个层输出一个)的形状为(batch_size, sequence_length, hidden_size)或(batch_size, num_channels, height, width),具体取决于主干网络。模型在每个阶段输出的隐藏状态以及初始嵌入输出。
attentions (
tuple(torch.FloatTensor), optional, returned whenoutput_attentions=Trueis passed or whenconfig.output_attentions=True) —torch.FloatTensor元组(每个层一个)的形状为(batch_size, num_heads, sequence_length, sequence_length)。仅当主干网络使用注意力时适用。注意力 softmax 后的注意力权重,用于计算自注意力头中的加权平均值。
示例
>>> from transformers import LwDetrViTConfig, LwDetrViTBackbone
>>> import torch
>>> config = LwDetrViTConfig()
>>> model = LwDetrViTBackbone(config)
>>> pixel_values = torch.randn(1, 3, 224, 224)
>>> with torch.no_grad():
... outputs = model(pixel_values)
>>> feature_maps = outputs.feature_maps
>>> list(feature_maps[-1].shape)
[1, 768, 14, 14]