Transformers 文档
条件 DETR
并获得增强的文档体验
开始使用
该模型于 2021 年 8 月 13 日在 HF papers 上发布,并于 2022 年 9 月 22 日贡献给 Hugging Face Transformers。
Conditional DETR
概述
Conditional DETR 模型由 Depu Meng, Xiaokang Chen, Zejia Fan, Gang Zeng, Houqiang Li, Yuhui Yuan, Lei Sun, Jingdong Wang 在 Conditional DETR for Fast Training Convergence 一文中提出。Conditional DETR 提出了一种用于快速 DETR 训练的条件交叉注意力机制。与 DETR 相比,Conditional DETR 的收敛速度快 6.7 到 10 倍。
论文摘要如下:
最近开发的 DETR 方法将 Transformer 编码器和解码器架构应用于目标检测,并取得了可观的性能。在本文中,我们解决了关键问题——训练收敛缓慢,并提出了一种用于快速 DETR 训练的条件交叉注意力机制。我们的方法受到以下事实启发:DETR 中的交叉注意力高度依赖内容嵌入(content embeddings)来定位四个极值点并预测边界框,这增加了对高质量内容嵌入的需求,从而提高了训练难度。我们的方法,即条件 DETR (conditional DETR),从解码器嵌入中学习条件空间查询(conditional spatial query),用于解码器多头交叉注意力。其优势在于,通过条件空间查询,每个交叉注意力头都能够关注包含不同区域(例如,一个目标极值点或目标边界框内的区域)的条带。这缩小了用于目标分类和边界框回归的定位区域的空间范围,从而降低了对内容嵌入的依赖并简化了训练。实验结果表明,对于 R50 和 R101 主干网络,conditional DETR 的收敛速度快 6.7 倍;对于更强大的主干网络 DC5-R50 和 DC5-R101,收敛速度快 10 倍。代码可在 https://github.com/Atten4Vis/ConditionalDETR 获取。
与原始 DETR 相比,Conditional DETR 显示出更快的收敛速度。摘自 原始论文。此模型由 DepuMeng 贡献。原始代码可以在 这里 找到。
资源
- 用于使用 Trainer 或 Accelerate 微调 ConditionalDetrForObjectDetection 的脚本可以在 这里 找到。
- 另请参阅:目标检测任务指南。
ConditionalDetrConfig
class transformers.ConditionalDetrConfig
< source >( transformers_version: str | None = None architectures: list[str] | None = None output_hidden_states: bool | None = False return_dict: bool | None = True dtype: typing.Union[str, ForwardRef('torch.dtype'), NoneType] = None chunk_size_feed_forward: int = 0 id2label: dict[int, str] | dict[str, str] | None = None label2id: dict[str, int] | dict[str, str] | None = None problem_type: typing.Optional[typing.Literal['regression', 'single_label_classification', 'multi_label_classification']] = None is_encoder_decoder: bool = True backbone_config: dict | transformers.configuration_utils.PreTrainedConfig | None = None num_channels: int = 3 num_queries: int = 300 encoder_layers: int = 6 encoder_ffn_dim: int = 2048 encoder_attention_heads: int = 8 decoder_layers: int = 6 decoder_ffn_dim: int = 2048 decoder_attention_heads: int = 8 encoder_layerdrop: float | int = 0.0 decoder_layerdrop: float | int = 0.0 activation_function: str = 'relu' d_model: int = 256 dropout: float | int = 0.1 attention_dropout: float | int = 0.0 activation_dropout: float | int = 0.0 init_std: float = 0.02 init_xavier_std: float = 1.0 auxiliary_loss: bool = False position_embedding_type: str = 'sine' dilation: bool = False class_cost: int = 2 bbox_cost: int = 5 giou_cost: int = 2 mask_loss_coefficient: int = 1 dice_loss_coefficient: int = 1 cls_loss_coefficient: int = 2 bbox_loss_coefficient: int = 5 giou_loss_coefficient: int = 2 focal_alpha: float = 0.25 )
参数
- is_encoder_decoder (
bool, optional, defaults toTrue) — 模型是否用作编码器/解码器。 - backbone_config (
Union[dict, ~configuration_utils.PreTrainedConfig], optional) — 主干模型的配置。 - num_channels (
int, optional, defaults to3) — 输入通道数。 - num_queries (
int, optional, defaults to 100) — 对象查询的数量,即检测槽。这是 ConditionalDetrModel 在单张图像中可以检测到的最大目标数。对于 COCO 数据集,我们建议使用 100 个查询。 - encoder_layers (
int, optional, defaults to6) — Transformer 编码器中的隐藏层数量。如果未设置,将使用与num_layers相同的值。 - encoder_ffn_dim (
int, optional, defaults to2048) — 编码器中“中间”(通常称为前馈)层的维度。 - encoder_attention_heads (
int, optional, defaults to8) — Transformer 编码器中每个注意力层的注意力头数。 - decoder_layers (
int, optional, defaults to6) — Transformer 解码器中的隐藏层数量。如果未设置,将使用与num_layers相同的值。 - decoder_ffn_dim (
int, optional, defaults to2048) — 解码器中“中间”(通常称为前馈)层的维度。 - decoder_attention_heads (
int, optional, defaults to8) — Transformer 解码器中每个注意力层的注意力头数。 - encoder_layerdrop (
Union[float, int], optional, defaults to0.0) — 编码器的 LayerDrop 概率。更多详细信息,请参阅 [LayerDrop 论文](参见 https://huggingface.co/papers/1909.11556)。 - decoder_layerdrop (
Union[float, int], optional, defaults to0.0) — 解码器的 LayerDrop 概率。更多详细信息,请参阅 [LayerDrop 论文](参见 https://huggingface.co/papers/1909.11556)。 - activation_function (
str, optional, defaults torelu) — 解码器中的非线性激活函数(函数或字符串)。例如:"gelu","relu","silu"等。 - d_model (
int, optional, defaults to256) — 编码器层和池化层的尺寸。 - dropout (
Union[float, int], optional, defaults to0.1) — 所有 dropout 层的比率。 - attention_dropout (
Union[float, int], optional, defaults to0.0) — 注意力概率的 dropout 比率。 - activation_dropout (
Union[float, int], optional, defaults to0.0) — 全连接层内部激活的 dropout 比率。 - init_std (
float, 可选, 默认值为0.02) — 用于初始化所有权重矩阵的 truncated_normal_initializer(截断正态分布初始化器)的标准差。 - init_xavier_std (
float, 可选, 默认值为1.0) — 用于交叉注意力权重 Xavier 初始化的缩放因子。 - auxiliary_loss (
bool, 可选, 默认值为False) — 是否使用辅助解码损失(即每一层解码器层产生的损失)。 - position_embedding_type (
str, 可选, 默认值为"sine") — 用于图像特征之上的位置编码类型。可选"sine"或"learned"。 - dilation (
bool, 可选, 默认值为False) — 是否在最后一个卷积块(DC5)中用扩张(dilation)代替步长(stride)。仅在use_timm_backbone=True时支持。 - class_cost (
int, 可选, 默认值为2) — 匈牙利匹配代价中分类误差的相对权重。 - bbox_cost (
int, 可选, 默认值为5) — 匈牙利匹配代价中 L1 边界框误差的相对权重。 - giou_cost (
int, 可选, 默认值为2) — 匈牙利匹配代价中广义 IoU (generalized IoU) 损失的相对权重。 - mask_loss_coefficient (
int, 可选, 默认值为1) — 全景分割损失中焦点损失(focal loss)的相对权重。 - dice_loss_coefficient (
int, 可选, 默认值为1) — 全景分割损失中 Dice 损失的相对权重。 - cls_loss_coefficient (
int, 可选, 默认值为2) — 全景分割损失中分类损失的相对权重。 - bbox_loss_coefficient (
int, 可选, 默认值为5) — 全景分割损失中 L1 边界框损失的相对权重。 - giou_loss_coefficient (
int, 可选, 默认值为2) — 全景分割损失中广义 IoU 损失的相对权重。 - focal_alpha (
float, 可选, 默认值为0.25) — 焦点损失中的 Alpha 参数。
这是用于存储 ConditionalDetrModel 配置的配置类。它根据指定的参数来实例化一个 Conditional Detr 模型,从而定义模型架构。使用默认值实例化配置将产生与 microsoft/conditional-detr-resnet-50 类似的配置。
配置对象继承自 PreTrainedConfig,可用于控制模型输出。阅读 PreTrainedConfig 的文档以获取更多信息。
示例
>>> from transformers import ConditionalDetrConfig, ConditionalDetrModel
>>> # Initializing a Conditional DETR microsoft/conditional-detr-resnet-50 style configuration
>>> configuration = ConditionalDetrConfig()
>>> # Initializing a model (with random weights) from the microsoft/conditional-detr-resnet-50 style configuration
>>> model = ConditionalDetrModel(configuration)
>>> # Accessing the model configuration
>>> configuration = model.configConditionalDetrImageProcessor
class transformers.ConditionalDetrImageProcessor
< 源代码 >( **kwargs: typing_extensions.Unpack[transformers.models.conditional_detr.image_processing_conditional_detr.ConditionalDetrImageProcessorKwargs] )
参数
- format (
str, kwargs, 可选, 默认值为AnnotationFormat.COCO_DETECTION) — 标注的数据格式。可选 “coco_detection” 或 “coco_panoptic”。 - do_convert_annotations (
bool, kwargs, 可选, 默认值为True) — 控制是否将标注转换为 CONDITIONAL_DETR 模型预期的格式。将边界框转换为(center_x, center_y, width, height)格式,且数值范围在[0, 1]之间。可以通过preprocess方法中的do_convert_annotations参数进行覆盖。 - **kwargs (ImagesKwargs, 可选) — 其他图像预处理选项。模型特定的 kwargs 列在上面;请查阅 TypedDict 类以获取支持的参数完整列表。
构建一个 ConditionalDetrImageProcessor 图像处理器。
preprocess
< 源代码 >( images: typing.Union[ForwardRef('PIL.Image.Image'), numpy.ndarray, ForwardRef('torch.Tensor'), list['PIL.Image.Image'], list[numpy.ndarray], list['torch.Tensor']] annotations: dict[str, int | str | list[dict]] | list[dict[str, int | str | list[dict]]] | None = None return_segmentation_masks: bool | None = None masks_path: str | pathlib.Path | None = None **kwargs: typing_extensions.Unpack[transformers.models.conditional_detr.image_processing_conditional_detr.ConditionalDetrImageProcessorKwargs] ) → ~image_processing_base.BatchFeature
参数
- images (
Union[PIL.Image.Image, numpy.ndarray, torch.Tensor, list[PIL.Image.Image], list[numpy.ndarray], list[torch.Tensor]]) — 待预处理的图像。期望单个图像或一批图像,像素值范围在 0 到 255 之间。如果传入像素值在 0 到 1 之间的图像,请设置do_rescale=False。 - annotations (
AnnotationType或list[AnnotationType], 可选) — 根据应用于图像的填充(padding)进行转换的标注。 - return_segmentation_masks (
bool, 可选, 默认值为self.return_segmentation_masks) — 是否返回分割掩码。 - masks_path (
str或pathlib.Path, 可选) — 包含分割掩码的目录路径。 - format (
str, kwargs, 可选, 默认值为AnnotationFormat.COCO_DETECTION) — 标注的数据格式。可选 “coco_detection” 或 “coco_panoptic”。 - do_convert_annotations (
bool, kwargs, 可选, 默认值为True) — 控制是否将标注转换为 CONDITIONAL_DETR 模型预期的格式。将边界框转换为(center_x, center_y, width, height)格式,且数值范围在[0, 1]之间。可以通过preprocess方法中的do_convert_annotations参数进行覆盖。 - return_tensors (
str或 TensorType, 可选) — 如果设置为'pt'则返回堆叠的张量,否则返回张量列表。 - **kwargs (ImagesKwargs, 可选) — 额外的图像预处理选项。模型特定的 kwargs 列在上面;请参阅 TypedDict 类以获取支持参数的完整列表。
返回
~image_processing_base.BatchFeature
- data (
dict) — 由 call 方法返回的列表/数组/张量字典(“pixel_values”等)。 - tensor_type (
Union[None, str, TensorType], optional) — 您可以在此处提供 tensor_type 以在初始化时将整数列表转换为 PyTorch/Numpy 张量。
ConditionalDetrImageProcessorPil
class transformers.ConditionalDetrImageProcessorPil
< 源码 >( **kwargs: typing_extensions.Unpack[transformers.models.conditional_detr.image_processing_pil_conditional_detr.ConditionalDetrImageProcessorKwargs] )
参数
- format (
str, kwargs, 可选, 默认为AnnotationFormat.COCO_DETECTION) — 标注的数据格式。可以是 “coco_detection” 或 “coco_panoptic”。 - do_convert_annotations (
bool, kwargs, 可选, 默认为True) — 控制是否将标注转换为 CONDITIONAL_DETR 模型所期望的格式。将边界框转换为(center_x, center_y, width, height)格式并归一化到[0, 1]范围内。可以被preprocess方法中的do_convert_annotations参数覆盖。 - **kwargs (ImagesKwargs, 可选) — 额外的图像预处理选项。模型特定的 kwargs 列在上面;请参阅 TypedDict 类以获取支持参数的完整列表。
构建一个 ConditionalDetrImageProcessor 图像处理器。
preprocess
< 源码 >( images: typing.Union[ForwardRef('PIL.Image.Image'), numpy.ndarray, ForwardRef('torch.Tensor'), list['PIL.Image.Image'], list[numpy.ndarray], list['torch.Tensor']] annotations: dict[str, int | str | list[dict]] | list[dict[str, int | str | list[dict]]] | None = None return_segmentation_masks: bool | None = None masks_path: str | pathlib.Path | None = None **kwargs: typing_extensions.Unpack[transformers.models.conditional_detr.image_processing_pil_conditional_detr.ConditionalDetrImageProcessorKwargs] ) → ~image_processing_base.BatchFeature
参数
- images (
Union[PIL.Image.Image, numpy.ndarray, torch.Tensor, list[PIL.Image.Image], list[numpy.ndarray], list[torch.Tensor]]) — 要预处理的图像。期望单个图像或一批图像,其像素值范围为 0 到 255。如果传入像素值在 0 到 1 之间的图像,请设置do_rescale=False。 - annotations (
AnnotationType或list[AnnotationType], 可选) — 根据应用于图像的填充进行转换的标注。 - return_segmentation_masks (
bool, 可选, 默认为self.return_segmentation_masks) — 是否返回分割掩码。 - masks_path (
str或pathlib.Path, 可选) — 包含分割掩码的目录路径。 - format (
str, kwargs, 可选, 默认为AnnotationFormat.COCO_DETECTION) — 标注的数据格式。可以是 “coco_detection” 或 “coco_panoptic”。 - do_convert_annotations (
bool, kwargs, 可选, 默认为True) — 控制是否将标注转换为 CONDITIONAL_DETR 模型所期望的格式。将边界框转换为(center_x, center_y, width, height)格式并归一化到[0, 1]范围内。可以被preprocess方法中的do_convert_annotations参数覆盖。 - return_tensors (
str或 TensorType, 可选) — 如果设置为'pt',则返回堆叠的张量,否则返回张量列表。 - **kwargs (ImagesKwargs, 可选) — 额外的图像预处理选项。模型特定的 kwargs 列在上面;请参阅 TypedDict 类以获取支持参数的完整列表。
返回
~image_processing_base.BatchFeature
- data (
dict) — 由 call 方法返回的列表/数组/张量字典(“pixel_values”等)。 - tensor_type (
Union[None, str, TensorType], optional) — 您可以在此处提供 tensor_type 以在初始化时将整数列表转换为 PyTorch/Numpy 张量。
post_process_object_detection
< 源码 >( outputs threshold: float = 0.5 target_sizes: transformers.utils.generic.TensorType | list[tuple] = None top_k: int = 100 ) → list[Dict]
参数
- outputs (
ConditionalDetrObjectDetectionOutput) — 模型的原始输出。 - threshold (
float, 可选) — 保留目标检测预测的分数阈值。 - target_sizes (
torch.Tensor或list[tuple[int, int]], 可选) — 形状为(batch_size, 2)的张量或包含批次中每张图像目标大小(高,宽)的元组列表。如果留空(None),则不会调整预测结果的大小。 - top_k (
int, 可选, 默认为 100) — 在通过阈值过滤之前,仅保留前 k 个边界框。
返回
list[Dict]
一个字典列表,每个字典包含模型预测的批处理中每张图像的分数、标签和框。
将 ConditionalDetrForObjectDetection 的原始输出转换为 (top_left_x, top_left_y, bottom_right_x, bottom_right_y) 格式的最终边界框。仅支持 PyTorch。
post_process_instance_segmentation
< 源码 >( outputs threshold: float = 0.5 mask_threshold: float = 0.5 overlap_mask_area_threshold: float = 0.8 target_sizes: list[tuple[int, int]] | None = None return_coco_annotation: bool | None = False ) → list[Dict]
参数
- outputs (ConditionalDetrForSegmentation) — 模型的原始输出。
- threshold (
float, 可选, 默认为 0.5) — 保留预测实例掩码的概率分数阈值。 - mask_threshold (
float, 可选, 默认为 0.5) — 将预测掩码转换为二进制值时使用的阈值。 - overlap_mask_area_threshold (
float, 可选, 默认为 0.8) — 用于合并或丢弃每个二进制实例掩码内小的断开部分的重叠掩码面积阈值。 - target_sizes (
list[Tuple], 可选) — 长度为 batch_size 的列表,其中每个列表项 (tuple[int, int]]) 对应于请求的每个预测的最终大小(高,宽)。如果未设置,则不会调整预测结果的大小。 - return_coco_annotation (
bool, 可选) — 默认为False。如果设置为True,则以 COCO 行程编码 (RLE) 格式返回分割图。
返回
list[Dict]
字典列表,每个图像一个,每个字典包含两个键
- segmentation — 形状为
(height, width)的张量,其中每个像素代表一个segment_id,如果 return_coco_annotation 设置为True,则为分割图的list[List]行程编码 (RLE)。如果未发现超过threshold的掩码,则设置为None。 - segments_info — 包含每个段的附加信息的字典。
- id — 表示
segment_id的整数。 - label_id — 表示与
segment_id对应的标签/语义类 ID 的整数。 - score — 具有
segment_id的段的预测分数。
- id — 表示
将 ConditionalDetrForSegmentation 的输出转换为实例分割预测。仅支持 PyTorch。
post_process_semantic_segmentation
< 源文件 >( outputs target_sizes: list[tuple[int, int]] | None = None ) → list[torch.Tensor]
参数
- outputs (ConditionalDetrForSegmentation) — 模型的原始输出。
- target_sizes (
list[tuple[int, int]], 可选) — 包含批次中每张图像目标尺寸(高,宽)的元组列表。如果未设置,则不会对预测结果进行调整大小。
返回
list[torch.Tensor]
一个长度为 batch_size 的列表,其中每个元素都是一个形状为 (height, width) 的语义分割图,对应于 target_sizes 条目(如果指定了 target_sizes)。每个 torch.Tensor 的条目对应一个语义类别 ID。
将 ConditionalDetrForSegmentation 的输出转换为语义分割图。仅支持 PyTorch。
post_process_panoptic_segmentation
< 源文件 >( outputs threshold: float = 0.5 mask_threshold: float = 0.5 overlap_mask_area_threshold: float = 0.8 label_ids_to_fuse: set[int] | None = None target_sizes: list[tuple[int, int]] | None = None ) → list[Dict]
参数
- outputs (ConditionalDetrForSegmentation) — 来自 ConditionalDetrForSegmentation 的输出。
- threshold (
float, 可选, 默认为 0.5) — 保留预测实例掩码的概率分数阈值。 - mask_threshold (
float, 可选, 默认为 0.5) — 将预测掩码转换为二进制值时使用的阈值。 - overlap_mask_area_threshold (
float, 可选, 默认为 0.8) — 用于合并或丢弃每个二进制实例掩码内的小型离散区域的重叠掩码面积阈值。 - label_ids_to_fuse (
Set[int], 可选) — 此集合中的标签对应的所有实例将被融合在一起。例如,我们可以说图像中只能有一个“天空”,但可以有多个人,因此天空的标签ID应包含在该集合中,而人的标签ID则不应包含。 - target_sizes (
list[Tuple], 可选) — 长度为 (batch_size) 的列表,其中每个列表项 (tuple[int, int]) 对应批次中每个预测结果所请求的最终尺寸(高,宽)。如果未设置,则不会对预测结果进行调整大小。
返回
list[Dict]
字典列表,每个图像一个,每个字典包含两个键
- segmentation — 一个形状为
(height, width)的张量,其中每个像素代表一个segment_id,如果没有找到超过threshold的掩码,则为None。如果指定了target_sizes,则分割结果会被调整大小以符合对应的target_sizes条目。 - segments_info — 包含每个段的附加信息的字典。
- id — 表示
segment_id的整数。 - label_id — 表示与
segment_id对应的标签/语义类 ID 的整数。 - was_fused — 一个布尔值,如果
label_id在label_ids_to_fuse中则为True,否则为False。同一类别/标签的多个实例已融合并分配了一个单独的segment_id。 - score — 具有
segment_id的段的预测分数。
- id — 表示
将 ConditionalDetrForSegmentation 的输出转换为图像全景分割预测。仅支持 PyTorch。
ConditionalDetrModel
class transformers.ConditionalDetrModel
< 源文件 >( config: ConditionalDetrConfig )
参数
- config (ConditionalDetrConfig) — 包含模型所有参数的模型配置类。使用配置文件初始化不会加载模型相关的权重,仅加载配置。查看 from_pretrained() 方法以加载模型权重。
纯 CONDITIONAL_DETR 模型(包含骨干网络和编码器-解码器 Transformer),输出原始隐藏状态,顶部没有任何特定头部。
该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。
此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。
forward
< 源文件 >( pixel_values: FloatTensor pixel_mask: torch.LongTensor | None = None decoder_attention_mask: torch.LongTensor | None = None encoder_outputs: torch.FloatTensor | None = None inputs_embeds: torch.FloatTensor | None = None decoder_inputs_embeds: torch.FloatTensor | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) → ConditionalDetrModelOutput 或 tuple(torch.FloatTensor)
参数
- pixel_values (
torch.FloatTensor,形状为(batch_size, num_channels, image_size, image_size)) — 对应于输入图像的张量。像素值可以使用image_processor_class获取。详情请参阅image_processor_class.__call__(processor_class使用image_processor_class来处理图像)。 - pixel_mask (
torch.LongTensor,形状为(batch_size, height, width),可选) — 用于避免对填充像素值进行注意力计算的掩码。掩码值在[0, 1]中选择:- 1 表示真实像素(即未被遮罩),
- 0 表示填充像素(即被遮罩)。
- decoder_attention_mask (
torch.FloatTensor,形状为(batch_size, num_queries),可选) — 默认不使用。可用于遮罩对象查询(object queries)。 - encoder_outputs (
torch.FloatTensor,可选) — 元组包含 (last_hidden_state,可选:hidden_states,可选:attentions)last_hidden_state,形状为(batch_size, sequence_length, hidden_size),可选,是编码器最后一层输出的隐藏状态序列。用于解码器的交叉注意力机制。 - inputs_embeds (
torch.FloatTensor,形状为(batch_size, sequence_length, hidden_size),可选) — 可选,除了传入扁平化特征图(骨干网络 + 投影层的输出),你还可以选择直接传入图像的扁平化表示。 - decoder_inputs_embeds (
torch.FloatTensor,形状为(batch_size, num_queries, hidden_size),可选) — 可选,除了使用零张量初始化查询,你还可以选择直接传入嵌入表示。
返回
ConditionalDetrModelOutput 或 tuple(torch.FloatTensor)
一个 ConditionalDetrModelOutput 或一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置(None)和输入包含各种元素。
ConditionalDetrModel 的前向传播方法,覆盖了 __call__ 特殊方法。
虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用
Module实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。
last_hidden_state (
torch.FloatTensor,形状为(batch_size, sequence_length, hidden_size)) — 模型解码器最后一层输出的隐藏状态序列。past_key_values (
EncoderDecoderCache,可选,在传递了use_cache=True或当config.use_cache=True时返回) — 这是一个 EncoderDecoderCache 实例。有关更多详细信息,请参阅我们的 KV 缓存指南。包含预先计算的隐藏状态(自注意力块和交叉注意力块中的键和值),可用于(参见
past_key_values输入)加速顺序解码。decoder_hidden_states (
tuple(torch.FloatTensor), optional, 当传入output_hidden_states=True或当config.output_hidden_states=True时返回) —torch.FloatTensor元组(一个用于嵌入的输出,如果模型有嵌入层,+ 一个用于每个层的输出),形状为(batch_size, sequence_length, hidden_size)。解码器在每个层输出的隐藏状态,加上可选的初始嵌入输出。
decoder_attentions (
tuple(torch.FloatTensor), optional, 当传入output_attentions=True或当config.output_attentions=True时返回) —torch.FloatTensor元组(每个层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。
cross_attentions (
tuple(torch.FloatTensor), optional, returned whenoutput_attentions=Trueis passed or whenconfig.output_attentions=True) — Tuple oftorch.FloatTensor(one for each layer) of shape(batch_size, num_heads, sequence_length, sequence_length).解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。
encoder_last_hidden_state (
torch.FloatTensor,形状为(batch_size, sequence_length, hidden_size),可选) — 模型编码器最后一层输出的隐藏状态序列。encoder_hidden_states (
tuple(torch.FloatTensor), optional, 当传入output_hidden_states=True或当config.output_hidden_states=True时返回) —torch.FloatTensor元组(一个用于嵌入的输出,如果模型有嵌入层,+ 一个用于每个层的输出),形状为(batch_size, sequence_length, hidden_size)。编码器在每个层输出的隐藏状态,加上可选的初始嵌入输出。
encoder_attentions (
tuple(torch.FloatTensor), optional, 当传入output_attentions=True或当config.output_attentions=True时返回) —torch.FloatTensor元组(每个层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。编码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。
intermediate_hidden_states (
torch.FloatTensorof shape(config.decoder_layers, batch_size, sequence_length, hidden_size), optional, returned whenconfig.auxiliary_loss=True) — Intermediate decoder activations, i.e. the output of each decoder layer, each of them gone through a layernorm.reference_points (
torch.FloatTensor,形状为(config.decoder_layers, batch_size, num_queries, 2 (锚点))) — 参考点(解码器每一层的参考点)。
示例
>>> from transformers import AutoImageProcessor, AutoModel
>>> from PIL import Image
>>> import httpx
>>> from io import BytesIO
>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> with httpx.stream("GET", url) as response:
... image = Image.open(BytesIO(response.read()))
>>> image_processor = AutoImageProcessor.from_pretrained("microsoft/conditional-detr-resnet-50")
>>> model = AutoModel.from_pretrained("microsoft/conditional-detr-resnet-50")
>>> # prepare image for the model
>>> inputs = image_processor(images=image, return_tensors="pt")
>>> # forward pass
>>> outputs = model(**inputs)
>>> # the last hidden states are the final query embeddings of the Transformer decoder
>>> # these are of shape (batch_size, num_queries, hidden_size)
>>> last_hidden_states = outputs.last_hidden_state
>>> list(last_hidden_states.shape)
[1, 300, 256]ConditionalDetrForObjectDetection
class transformers.ConditionalDetrForObjectDetection
< 源文件 >( config: ConditionalDetrConfig )
参数
- config (ConditionalDetrConfig) — 包含模型所有参数的模型配置类。使用配置文件初始化不会加载模型相关的权重,仅加载配置。查看 from_pretrained() 方法以加载模型权重。
带有顶部目标检测头的 CONDITIONAL_DETR 模型(包含骨干网络和编码器-解码器 Transformer),用于 COCO 检测等任务。
该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。
此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。
forward
< 源文件 >( pixel_values: FloatTensor pixel_mask: torch.LongTensor | None = None decoder_attention_mask: torch.LongTensor | None = None encoder_outputs: torch.FloatTensor | None = None inputs_embeds: torch.FloatTensor | None = None decoder_inputs_embeds: torch.FloatTensor | None = None labels: list[dict] | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) → ConditionalDetrObjectDetectionOutput 或 tuple(torch.FloatTensor)
参数
- pixel_values (
torch.FloatTensor,形状为(batch_size, num_channels, image_size, image_size)) — 对应于输入图像的张量。像素值可以使用image_processor_class获取。详情请参阅image_processor_class.__call__(processor_class使用image_processor_class来处理图像)。 - pixel_mask (
torch.LongTensor,形状为(batch_size, height, width),可选) — 用于避免对填充像素值进行注意力计算的掩码。掩码值在[0, 1]中选择:- 1 表示真实像素(即未被遮罩),
- 0 表示填充像素(即被遮罩)。
- decoder_attention_mask (
torch.FloatTensor,形状为(batch_size, num_queries),可选) — 默认不使用。可用于屏蔽目标查询 (object queries)。 - encoder_outputs (
torch.FloatTensor,可选) — 元组包含 (last_hidden_state,可选:hidden_states,可选:attentions),last_hidden_state形状为(batch_size, sequence_length, hidden_size),可选,是编码器最后一层输出的隐藏状态序列。用于解码器的交叉注意力机制。 - inputs_embeds (
torch.FloatTensor,形状为(batch_size, sequence_length, hidden_size),可选) — 可选,除了传入展平后的特征图(骨干网络 + 投影层的输出),你还可以选择直接传入图像的展平表示。 - decoder_inputs_embeds (
torch.FloatTensor,形状为(batch_size, num_queries, hidden_size),可选) — 可选,除了使用零张量初始化查询外,你还可以选择直接传入嵌入表示。 - labels (
list[Dict],长度为(batch_size,),可选) — 用于计算二分匹配损失的标签。由字典组成的列表,每个字典至少包含以下两个键:‘class_labels’ 和 ‘boxes’(分别是批次中某张图像的类别标签和边界框)。类别标签本身应为长度为(图像中边界框数量,)的torch.LongTensor,边界框应为形状为(图像中边界框数量, 4)的torch.FloatTensor。
返回
ConditionalDetrObjectDetectionOutput 或 tuple(torch.FloatTensor)
一个 ConditionalDetrObjectDetectionOutput 或一个 torch.FloatTensor 元组(如果传入 return_dict=False 或 config.return_dict=False),根据配置(None)和输入包含不同的元素。
ConditionalDetrForObjectDetection 的前向传播方法,覆盖了 __call__ 特殊方法。
虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用
Module实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。
loss (
torch.FloatTensorof shape(1,), optional, 当提供labels时返回)) — 总损失,是类别预测的负对数似然(交叉熵)和边界框损失的线性组合。后者定义为 L1 损失和广义尺度不变 IoU 损失的线性组合。loss_dict (
Dict, 可选) — 包含各个损失的字典。用于日志记录。logits (形状为
(batch_size, num_queries, num_classes + 1)的torch.FloatTensor) — 所有查询的分类 logits(包括无对象)。pred_boxes (
torch.FloatTensor,形状为(batch_size, num_queries, 4)) — 所有查询的归一化边界框坐标,表示为 (center_x, center_y, width, height)。这些值相对于批次中每张图像的大小(忽略可能的填充)在 [0, 1] 范围内进行归一化。你可以使用post_process_object_detection()来获取未归一化的边界框。auxiliary_outputs (
list[Dict], optional) — 可选,仅在启用了辅助损失(即config.auxiliary_loss设置为True)且提供了标签时返回。它是一个字典列表,包含每个解码器层的上述两个键(logits和pred_boxes)。last_hidden_state (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor,可选) — 模型解码器最后一层输出的隐藏状态序列。decoder_hidden_states (
tuple[torch.FloatTensor], 可选, 当传递output_hidden_states=True或当config.output_hidden_states=True时返回) —torch.FloatTensor元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为(batch_size, sequence_length, hidden_size)。解码器在每一层输出时的隐藏状态以及初始嵌入输出。
decoder_attentions (
tuple[torch.FloatTensor], 可选, 当传递output_attentions=True或当config.output_attentions=True时返回) —torch.FloatTensor元组(每一层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。
cross_attentions (
tuple[torch.FloatTensor], 可选,当传入output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。
encoder_last_hidden_state (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor, 可选, 默认为None) — 模型编码器最后一层输出的隐状态序列。encoder_hidden_states (
tuple[torch.FloatTensor], 可选, 当传递output_hidden_states=True或当config.output_hidden_states=True时返回) —torch.FloatTensor元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为(batch_size, sequence_length, hidden_size)。编码器在每一层输出时的隐藏状态以及初始嵌入输出。
encoder_attentions (
tuple[torch.FloatTensor], 可选, 当传递output_attentions=True或当config.output_attentions=True时返回) —torch.FloatTensor元组(每一层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。编码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。
示例
>>> from transformers import AutoImageProcessor, AutoModelForObjectDetection
>>> from PIL import Image
>>> import httpx
>>> from io import BytesIO
>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> with httpx.stream("GET", url) as response:
... image = Image.open(BytesIO(response.read()))
>>> image_processor = AutoImageProcessor.from_pretrained("microsoft/conditional-detr-resnet-50")
>>> model = AutoModelForObjectDetection.from_pretrained("microsoft/conditional-detr-resnet-50")
>>> inputs = image_processor(images=image, return_tensors="pt")
>>> outputs = model(**inputs)
>>> # convert outputs (bounding boxes and class logits) to Pascal VOC format (xmin, ymin, xmax, ymax)
>>> target_sizes = torch.tensor([image.size[::-1]])
>>> results = image_processor.post_process_object_detection(outputs, threshold=0.5, target_sizes=target_sizes)[
... 0
... ]
>>> for score, label, box in zip(results["scores"], results["labels"], results["boxes"]):
... box = [round(i, 2) for i in box.tolist()]
... print(
... f"Detected {model.config.id2label[label.item()]} with confidence "
... f"{round(score.item(), 3)} at location {box}"
... )
Detected remote with confidence 0.833 at location [38.31, 72.1, 177.63, 118.45]
Detected cat with confidence 0.831 at location [9.2, 51.38, 321.13, 469.0]
Detected cat with confidence 0.804 at location [340.3, 16.85, 642.93, 370.95]
Detected remote with confidence 0.683 at location [334.48, 73.49, 366.37, 190.01]
Detected couch with confidence 0.535 at location [0.52, 1.19, 640.35, 475.1]ConditionalDetrForSegmentation
class transformers.ConditionalDetrForSegmentation
< 源代码 >( config: ConditionalDetrConfig )
参数
- config (ConditionalDetrConfig) — 包含模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,只会加载配置。查看 from_pretrained() 方法以加载模型权重。
CONDITIONAL_DETR 模型(由骨干网络和编码器-解码器 Transformer 组成),顶部带有分割头,用于 COCO 全景分割等任务。
该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。
此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。
forward
< 源代码 >( pixel_values: FloatTensor pixel_mask: torch.LongTensor | None = None decoder_attention_mask: torch.FloatTensor | None = None encoder_outputs: torch.FloatTensor | None = None inputs_embeds: torch.FloatTensor | None = None decoder_inputs_embeds: torch.FloatTensor | None = None labels: list[dict] | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) → ConditionalDetrSegmentationOutput 或 tuple(torch.FloatTensor)
参数
- pixel_values (
torch.FloatTensor,形状为(batch_size, num_channels, image_size, image_size)) — 对应输入图像的张量。像素值可以使用image_processor_class获取。详情请参见image_processor_class.__call__(processor_class使用image_processor_class来处理图像)。 - pixel_mask (
torch.LongTensor,形状为(batch_size, height, width),可选) — 避免对填充像素值进行注意力计算的掩码。掩码值在[0, 1]中选择:- 1 表示真实像素(即未被屏蔽),
- 0 表示填充像素(即已被屏蔽)。
- decoder_attention_mask (
torch.FloatTensor,形状为(batch_size, num_queries),可选) — 避免对解码器中某些目标查询进行注意力计算的掩码。掩码值在[0, 1]中选择:- 1 表示未被屏蔽的查询,
- 0 表示已被屏蔽的查询。
- encoder_outputs (
torch.FloatTensor,可选) — 元组包含 (last_hidden_state,可选:hidden_states,可选:attentions),last_hidden_state形状为(batch_size, sequence_length, hidden_size),可选,是编码器最后一层输出的隐藏状态序列。用于解码器的交叉注意力机制。 - inputs_embeds (
torch.FloatTensor,形状为(batch_size, sequence_length, hidden_size),可选) — 为保持向后兼容性而保留,但不能用于分割,因为分割需要来自骨干网络的多尺度特征,而绕过骨干网络使用 inputs_embeds 时无法获得这些特征。 - decoder_inputs_embeds (
torch.FloatTensor,形状为(batch_size, num_queries, hidden_size),可选) — 可选,除了使用零张量初始化查询外,你还可以选择直接传入嵌入表示。适用于需要自定义查询初始化的任务。 - labels (
list[Dict],长度为(batch_size,),可选) — 用于计算二分匹配损失、DICE/F-1 损失和 Focal 损失的标签。由字典组成的列表,每个字典至少包含以下 3 个键:‘class_labels’、‘boxes’ 和 ‘masks’(分别是批次中某张图像的类别标签、边界框和分割掩码)。类别标签应为长度为(图像中边界框数量,)的torch.LongTensor,边界框应为形状为(图像中边界框数量, 4)的torch.FloatTensor,掩码应为形状为(图像中边界框数量, height, width)的torch.FloatTensor。
返回
ConditionalDetrSegmentationOutput 或 tuple(torch.FloatTensor)
一个 ConditionalDetrSegmentationOutput 或一个 torch.FloatTensor 元组(如果传入 return_dict=False 或 config.return_dict=False),根据配置(None)和输入包含不同的元素。
ConditionalDetrForSegmentation 的前向传播方法,覆盖了 __call__ 特殊方法。
虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用
Module实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。
loss (
torch.FloatTensorof shape(1,), optional, 当提供labels时返回)) — 总损失,是类别预测的负对数似然(交叉熵)和边界框损失的线性组合。后者定义为 L1 损失和广义尺度不变 IoU 损失的线性组合。loss_dict (
Dict, 可选) — 包含各个损失的字典。用于日志记录。logits (形状为
(batch_size, num_queries, num_classes + 1)的torch.FloatTensor) — 所有查询的分类 logits(包括无对象)。pred_boxes (
torch.FloatTensor,形状为(batch_size, num_queries, 4)) — 所有查询的归一化边界框坐标,表示为 (center_x, center_y, width, height)。这些值相对于批次中每张图像的大小(忽略可能的填充)在 [0, 1] 范围内进行归一化。你可以使用post_process_object_detection()来获取未归一化的边界框。pred_masks (
torch.FloatTensor,形状为(batch_size, num_queries, height/4, width/4)) — 所有查询的分割掩码逻辑值。另请参见post_process_semantic_segmentation()或post_process_instance_segmentation()和post_process_panoptic_segmentation(),以分别评估语义、实例和全景分割掩码。auxiliary_outputs (
list[Dict], optional) — 可选,仅在启用了辅助损失(即config.auxiliary_loss设置为True)且提供了标签时返回。它是一个字典列表,包含每个解码器层的上述两个键(logits和pred_boxes)。last_hidden_state (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor,可选) — 模型解码器最后一层输出的隐藏状态序列。decoder_hidden_states (
tuple[torch.FloatTensor], 可选, 当传递output_hidden_states=True或当config.output_hidden_states=True时返回) —torch.FloatTensor元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为(batch_size, sequence_length, hidden_size)。解码器在每一层输出时的隐藏状态以及初始嵌入输出。
decoder_attentions (
tuple[torch.FloatTensor], 可选, 当传递output_attentions=True或当config.output_attentions=True时返回) —torch.FloatTensor元组(每一层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。
cross_attentions (
tuple[torch.FloatTensor], 可选,当传入output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。
encoder_last_hidden_state (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor, 可选, 默认为None) — 模型编码器最后一层输出的隐状态序列。encoder_hidden_states (
tuple[torch.FloatTensor], 可选, 当传递output_hidden_states=True或当config.output_hidden_states=True时返回) —torch.FloatTensor元组(如果模型有嵌入层,则一个用于嵌入层的输出,+ 一个用于每一层的输出),形状为(batch_size, sequence_length, hidden_size)。编码器在每一层输出时的隐藏状态以及初始嵌入输出。
encoder_attentions (
tuple[torch.FloatTensor], 可选, 当传递output_attentions=True或当config.output_attentions=True时返回) —torch.FloatTensor元组(每一层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。编码器的注意力权重,在注意力 softmax 之后,用于计算自注意力头中的加权平均。
示例
>>> import io
>>> import httpx
>>> from io import BytesIO
>>> from PIL import Image
>>> import torch
>>> import numpy
>>> from transformers import AutoImageProcessor, ConditionalDetrForSegmentation
>>> from transformers.image_transforms import rgb_to_id
>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> with httpx.stream("GET", url) as response:
... image = Image.open(BytesIO(response.read()))
>>> image_processor = AutoImageProcessor.from_pretrained("facebook/conditional_detr-resnet-50-panoptic")
>>> model = ConditionalDetrForSegmentation.from_pretrained("facebook/conditional_detr-resnet-50-panoptic")
>>> # prepare image for the model
>>> inputs = image_processor(images=image, return_tensors="pt")
>>> # forward pass
>>> outputs = model(**inputs)
>>> # Use the `post_process_panoptic_segmentation` method of the `image_processor` to retrieve post-processed panoptic segmentation maps
>>> # Segmentation results are returned as a list of dictionaries
>>> result = image_processor.post_process_panoptic_segmentation(outputs, target_sizes=[(300, 500)])
>>> # A tensor of shape (height, width) where each value denotes a segment id, filled with -1 if no segment is found
>>> panoptic_seg = result[0]["segmentation"]
>>> panoptic_seg.shape
torch.Size([300, 500])
>>> # Get prediction score and segment_id to class_id mapping of each segment
>>> panoptic_segments_info = result[0]["segments_info"]
>>> len(panoptic_segments_info)
5