Transformers 文档
RF-DETR
并获得增强的文档体验
开始使用
该模型于 2024 年 7 月 24 日在 HF 论文中发布,并于 2026 年 5 月 7 日贡献给 Hugging Face Transformers。
RF-DETR
RF-DETR 提出了一种感受野检测 Transformer (DETR) 架构,旨在与占据主导地位的 YOLO 系列竞争并在实时目标检测中实现超越。通过结合最新的 Transformer 技术和高效的设计选择,它在速度(延迟)和精度(mAP)之间达到了新的最先进平衡。
RF-DETR 架构的特点在于其简单而高效的结构:DINOv2 主干网络 (Backbone)、投影层 (Projector) 和浅层 DETR 解码器。它通过以下核心修改增强了 DETR 架构的效率和速度:
- DINOv2 主干网络:使用强大的 DINOv2 主干网络进行稳健的特征提取。
- 分组 DETR 训练 (Group DETR Training):在训练过程中利用分组一对多分配 (Group-Wise One-to-Many Assignment) 来加速收敛。
- 更丰富的输入:聚合来自主干网络的多级特征,并使用 C2f 投影层(类似于 YOLOv8)来传递多尺度特征。
- 更快的解码器:采用具有可变形交叉注意力的浅层 3 层 DETR 解码器,以降低延迟。
- 优化查询 (Optimized Queries):使用结合了可学习内容查询和生成空间查询的混合查询方案。
您可以在 Roboflow 组织下找到所有可用的 RF-DETR 检查点。原始代码可以在此处找到。
得益于权重转换映射,RfDetr 不仅兼容来自原始 rf-detr 库的模型,也兼容您使用 Roboflow 平台训练的模型。这意味着您可以使用 Roboflow 平台训练模型,并使用 transformers 中的 RfDetr 导入权重,从而将您的模型部署到任何地方。
点击右侧边栏中的 RF-DETR 模型,查看更多如何将 RF-DETR 应用于不同目标检测任务的示例。
下面的示例演示了如何使用 Pipeline 和 AutoModel 类执行目标检测。
from transformers import pipeline
import torch
pipeline = pipeline("object-detection", model="Roboflow/rf-detr-medium", device_map="auto")
pipeline("http://images.cocodataset.org/val2017/000000039769.jpg")使用 supervision 可视化结果
您可以使用 supervision 库来可视化检测和分割结果。通过 pip install supervision 进行安装。
from transformers import AutoImageProcessor, AutoModelForObjectDetection
from PIL import Image
import supervision as sv
import requests
import torch
url = "http://images.cocodataset.org/val2017/000000039769.jpg"
image = Image.open(requests.get(url, stream=True).raw)
image_processor = AutoImageProcessor.from_pretrained("Roboflow/rf-detr-medium")
model = AutoModelForObjectDetection.from_pretrained("Roboflow/rf-detr-medium", device_map="auto")
inputs = image_processor(images=image, return_tensors="pt").to(model.device)
with torch.no_grad():
outputs = model(**inputs)
results = image_processor.post_process_object_detection(
outputs, target_sizes=torch.tensor([image.size[::-1]]), threshold=0.3
)[0]
detections = sv.Detections.from_transformers(
transformers_results=results, id2label=model.config.id2label
)
box_annotator = sv.BoxAnnotator()
label_annotator = sv.LabelAnnotator()
annotated_image = image.copy()
annotated_image = box_annotator.annotate(annotated_image, detections)
annotated_image = label_annotator.annotate(annotated_image, detections)
sv.plot_image(annotated_image)资源
- 使用 Trainer 或 Accelerate 微调 RfDetrForObjectDetection 的脚本可以在此处找到。
- 另请参阅:目标检测任务指南。
RfDetrConfig
class transformers.RfDetrConfig
< 源代码 >( transformers_version: str | None = None architectures: list[str] | None = None output_hidden_states: bool | None = False return_dict: bool | None = True dtype: typing.Union[str, ForwardRef('torch.dtype'), NoneType] = None chunk_size_feed_forward: int = 0 is_encoder_decoder: bool = False id2label: dict[int, str] | dict[str, str] | None = None label2id: dict[str, int] | dict[str, str] | None = None problem_type: typing.Optional[typing.Literal['regression', 'single_label_classification', 'multi_label_classification']] = None backbone_config: dict | transformers.configuration_utils.PreTrainedConfig | None = None hidden_expansion: float = 0.5 c2f_num_blocks: int = 3 activation_function: str = 'silu' dropout: float = 0.1 decoder_ffn_dim: int = 2048 decoder_n_points: int = 4 decoder_layers: int = 3 decoder_self_attention_heads: int = 8 decoder_cross_attention_heads: int = 16 decoder_activation_function: str = 'relu' num_queries: int = 300 attention_bias: bool = True attention_dropout: float | int = 0.0 activation_dropout: float | int = 0.0 group_detr: int = 13 init_std: float = 0.02 disable_custom_kernels: bool = True class_cost: int | float = 2 bbox_cost: int | float = 5 giou_cost: int | float = 2 class_loss_coefficient: int | float = 1 dice_loss_coefficient: int | float = 1 bbox_loss_coefficient: int | float = 5 giou_loss_coefficient: int | float = 2 eos_coefficient: float = 0.1 focal_alpha: float = 0.25 auxiliary_loss: bool = True d_model: int = 256 layer_norm_eps: float = 1e-05 num_feature_levels: int = 1 mask_loss_coefficient: int | float = 1 mask_point_sample_ratio: int = 16 mask_downsample_ratio: int = 4 mask_class_loss_coefficient: int | float = 5.0 mask_dice_loss_coefficient: int | float = 5.0 segmentation_head_activation_function: str = 'gelu' intermediate_size: int = 1024 )
参数
- backbone_config (
Union[dict, ~configuration_utils.PreTrainedConfig], 可选) — 主干模型的配置。 - hidden_expansion (
float, 可选, 默认为 0.5) — 投影层中隐藏维度的扩展因子。 - c2f_num_blocks (
int, 可选, 默认为 3) — C2F 层中的块数。 - activation_function (
str, 可选, 默认为"silu") — 投影层中的非线性激活函数。支持的值为"silu","relu","gelu"。 - dropout (
float, 可选, 默认为0.1) — 所有 dropout 层的比率。 - decoder_ffn_dim (
int, 可选, 默认为2048) — 解码器中“中间”(通常称为前馈)层的维度。 - decoder_n_points (
int, 可选, 默认为 4) — 解码器中每个注意力头在每个特征级别采样的键数量。 - decoder_layers (
int, 可选, 默认为 3) — Transformer 中的解码器层数。 - decoder_self_attention_heads (
int, 可选, 默认为 8) — 解码器自注意力中每个注意力层的注意力头数。 - decoder_cross_attention_heads (
int, 可选, 默认为 16) — 解码器交叉注意力中每个注意力层的注意力头数。 - decoder_activation_function (
str, 可选, 默认为"relu") — 解码器中的非线性激活函数。支持的值为"relu","silu","gelu"。 - num_queries (
int, 可选, 默认为 300) — 对象查询的数量,即检测槽位。这是 RfDetrModel 在单张图像中可以检测到的最大对象数量。 - attention_bias (
bool, 可选, 默认为True) — 是否在自注意力期间的查询、键、值和输出投影层中使用偏置。 - attention_dropout (
Union[float, int], 可选, 默认为0.0) — 注意力概率的 dropout 比率。 - activation_dropout (
Union[float, int], 可选, 默认为0.0) — 全连接层内激活值的 dropout 比率。 - group_detr (
int, 可选, 默认为 13) — Group DETR 注意力机制的分组数量,有助于降低计算复杂度。 - init_std (
float, 可选, 默认为0.02) — 用于初始化所有权重矩阵的 truncated_normal_initializer 的标准差。 - disable_custom_kernels (
bool, 可选, 默认为True) — 禁用自定义 CUDA 和 CPU 内核。此选项对于 ONNX 导出是必要的,因为 PyTorch ONNX 导出不支持自定义内核。 - class_cost (
Union[int, float], 可选, 默认为2) — 匈牙利匹配成本中分类误差的相对权重。 - bbox_cost (
Union[int, float], 可选, 默认为5) — 匈牙利匹配成本中 L1 边界框误差的相对权重。 - giou_cost (
Union[int, float], optional, defaults to2) — 匈牙利匹配代价中广义 IoU 损失的相对权重。 - class_loss_coefficient (
float, optional, defaults to 1) — 匈牙利匹配代价中分类损失的相对权重。 - dice_loss_coefficient (
float, optional, defaults to 1) — 目标检测损失中 DICE/F-1 损失的相对权重。 - bbox_loss_coefficient (
float, optional, defaults to 5) — 目标检测损失中 L1 边界框损失的相对权重。 - giou_loss_coefficient (
float, optional, defaults to 2) — 目标检测损失中广义 IoU 损失的相对权重。 - eos_coefficient (
float, optional, defaults to0.1) — 目标检测损失中“无目标”(no-object)类别的相对分类权重。 - focal_alpha (
float, optional, defaults to0.25) — Focal loss 中的 Alpha 参数。 - auxiliary_loss (
bool, optional, defaults toTrue) — 是否使用辅助解码损失(即每个解码器层上的损失)。 - d_model (
int, optional, defaults to256) — 编码器层和池化层的维度大小。 - layer_norm_eps (
float, optional, defaults to1e-05) — 层归一化(Layer Normalization)层所使用的 epsilon 值。 - num_feature_levels (
int, optional, defaults to 1) — 多尺度可变形注意力(multiscale deformable attention)中使用的特征层级数量。 - mask_loss_coefficient (
float, optional, defaults to 1) — 实例分割掩码损失中 Focal 损失的相对权重。 - mask_point_sample_ratio (
int, optional, defaults to 16) — 计算掩码损失时采样的点比例。 - mask_downsample_ratio (
int, optional, defaults to 4) — 分割掩码相对于输入图像分辨率的下采样比例。 - mask_class_loss_coefficient (
float, optional, defaults to 5.0) — 实例分割损失中 Focal 损失的相对权重。 - mask_dice_loss_coefficient (
float, optional, defaults to 5.0) — 实例分割损失中 DICE/F-1 损失的相对权重。 - segmentation_head_activation_function (
str, optional, defaults to"gelu") — 分割头中的非线性激活函数。支持的值为"relu","silu","gelu"。 - intermediate_size (
int, optional, defaults to1024) — MLP 表示的维度。
这是用于存储 RfDetrModel 配置的配置类。它根据指定的参数实例化 Rf Detr 模型,定义模型架构。使用默认值实例化配置将产生与 Roboflow/rf-detr-base 类似的配置。
配置对象继承自 PreTrainedConfig,可用于控制模型输出。阅读 PreTrainedConfig 的文档以获取更多信息。
示例
>>> from transformers import RfDetrConfig, RfDetrModel
>>> # Initializing a RF-DETR roboflow/rf-detr-base style configuration
>>> configuration = RfDetrConfig()
>>> # Initializing a model (with random weights) from the Roboflow/rf-detr-base style configuration
>>> model = RfDetrModel(configuration)
>>> # Accessing the model configuration
>>> configuration = model.configRfDetrDinov2Config
class transformers.RfDetrDinov2Config
< 源代码 >( transformers_version: str | None = None architectures: list[str] | None = None output_hidden_states: bool | None = False return_dict: bool | None = True dtype: typing.Union[str, ForwardRef('torch.dtype'), NoneType] = None chunk_size_feed_forward: int = 0 is_encoder_decoder: bool = False id2label: dict[int, str] | dict[str, str] | None = None label2id: dict[str, int] | dict[str, str] | None = None problem_type: typing.Optional[typing.Literal['regression', 'single_label_classification', 'multi_label_classification']] = None hidden_size: int = 768 num_hidden_layers: int = 12 num_attention_heads: int = 12 mlp_ratio: int = 4 hidden_act: str = 'gelu' hidden_dropout_prob: float | int = 0.0 attention_probs_dropout_prob: float | int = 0.0 initializer_range: float = 0.02 layer_norm_eps: float = 1e-06 image_size: int | list[int] | tuple[int, int] = 224 patch_size: int | list[int] | tuple[int, int] = 14 num_channels: int = 3 qkv_bias: bool = True layerscale_value: float = 1.0 drop_path_rate: float | int = 0.0 use_swiglu_ffn: bool = False _out_features: list[str] | None = None _out_indices: list[int] | None = None apply_layernorm: bool = True reshape_hidden_states: bool = True use_mask_token: bool = True num_windows: int = 4 )
参数
- hidden_size (
int, optional, defaults to768) — 隐藏表示的维度。 - num_hidden_layers (
int, optional, defaults to12) — Transformer 解码器中的隐藏层数量。 - num_attention_heads (
int, optional, defaults to12) — Transformer 解码器中每个注意力层的注意力头数量。 - mlp_ratio (
int, optional, defaults to4) — MLP 隐藏维度与嵌入维度的比率。 - hidden_act (
str, optional, defaults togelu) — 解码器中的非线性激活函数(函数或字符串)。例如:"gelu"、"relu"、"silu"等。 - hidden_dropout_prob (
Union[float, int], optional, defaults to0.0) — 嵌入层、编码器和池化层中所有全连接层的丢弃(dropout)概率。 - attention_probs_dropout_prob (
Union[float, int], optional, defaults to0.0) — 注意力概率的丢弃比率。 - initializer_range (
float, optional, defaults to0.02) — 用于初始化所有权重矩阵的截断正态分布初始化器(truncated_normal_initializer)的标准差。 - layer_norm_eps (
float, optional, defaults to1e-06) — 层归一化层使用的 epsilon 值。 - image_size (
Union[int, list[int], tuple[int, int]], optional, defaults to224) — 每张图像的大小(分辨率)。 - patch_size (
Union[int, list[int], tuple[int, int]], optional, defaults to14) — 每个分块(patch)的大小(分辨率)。 - num_channels (
int, optional, defaults to3) — 输入通道数。 - qkv_bias (
bool, optional, defaults toTrue) — 是否为查询(queries)、键(keys)和值(values)添加偏置。 - layerscale_value (
float, optional, defaults to 1.0) — 层缩放(layer scale)使用的初始值。 - drop_path_rate (
float, optional, defaults to 0.0) — 每个样本的随机深度(stochastic depth)比率(当应用于残差层的主路径时)。 - use_swiglu_ffn (
bool, optional, defaults toFalse) — 是否使用 SwiGLU 前馈神经网络。 - apply_layernorm (
bool, optional, defaults toTrue) — 如果模型用作主干网络(backbone),是否对特征图应用层归一化。 - reshape_hidden_states (
bool, optional, defaults toTrue) — 如果模型用作主干网络,是否将特征图重塑为形状为(batch_size, d_model, height, width)的 4D 张量。如果为False,特征图将是形状为(batch_size, seq_len, d_model)的 3D 张量。 - use_mask_token (
bool, optional, defaults toTrue) — 是否在嵌入中使用 mask_token。 - num_windows (
int, optional, defaults to 4) — 用于窗口化注意力(windowed attention)的窗口数量。如果为 1,则不使用窗口化注意力。
这是用于存储 RfDetrModel 配置的配置类。它根据指定的参数实例化 Rf Detr 模型,定义模型架构。使用默认值实例化配置将产生与 Roboflow/rf-detr-base 类似的配置。
配置对象继承自 PreTrainedConfig,可用于控制模型输出。阅读 PreTrainedConfig 的文档以获取更多信息。
示例
>>> from transformers import RfDetrDinov2Config, RfDetrDinov2Backbone
>>> # Initializing a RfDetrDinov2 base style configuration
>>> configuration = RfDetrDinov2Config()
>>> # Initializing a model (with random weights) from the base style configuration
>>> model = RfDetrDinov2Backbone(configuration)
>>> # Accessing the model configuration
>>> configuration = model.configRfDetrImageProcessor
class transformers.RfDetrImageProcessor
< 源代码 >( **kwargs: typing_extensions.Unpack[transformers.models.rf_detr.image_processing_rf_detr.RfDetrImageProcessorKwargs] )
参数
- format (
str, kwargs, optional, defaults toAnnotationFormat.COCO_DETECTION) — 标注的数据格式。为 “coco_detection” 或 “coco_panoptic” 之一。 - do_convert_annotations (
bool, kwargs, optional, defaults toTrue) — 控制是否将标注转换为 RF_DETR 模型预期的格式。将边界框转换为(center_x, center_y, width, height)格式并归一化到[0, 1]范围内。可以通过preprocess方法中的do_convert_annotations参数进行覆盖。 - **kwargs (ImagesKwargs, optional) — 其他图像预处理选项。模型特定的 kwargs 列在上面;请参阅 TypedDict 类以获取支持参数的完整列表。
构建一个 RfDetrImageProcessor 图像处理器。
preprocess
< 源代码 >( images: typing.Union[ForwardRef('PIL.Image.Image'), numpy.ndarray, ForwardRef('torch.Tensor'), list['PIL.Image.Image'], list[numpy.ndarray], list['torch.Tensor']] annotations: dict[str, int | str | list[dict]] | list[dict[str, int | str | list[dict]]] | None = None return_segmentation_masks: bool | None = None masks_path: str | pathlib.Path | None = None **kwargs: typing_extensions.Unpack[transformers.models.rf_detr.image_processing_rf_detr.RfDetrImageProcessorKwargs] ) → ~image_processing_base.BatchFeature
参数
- images (
Union[PIL.Image.Image, numpy.ndarray, torch.Tensor, list[PIL.Image.Image], list[numpy.ndarray], list[torch.Tensor]]) — 需要预处理的图像。期望输入为单张或一批像素值在 0 到 255 之间的图像。如果传入像素值在 0 到 1 之间的图像,请设置do_rescale=False。 - annotations (
AnnotationType或list[AnnotationType], optional) — 根据应用于图像的填充(padding)进行转换的标注。 - return_segmentation_masks (
bool, optional, defaults toself.return_segmentation_masks) — 是否返回分割掩码。 - masks_path (
str或pathlib.Path, optional) — 包含分割掩码的目录路径。 - format (
str, kwargs, optional, defaults toAnnotationFormat.COCO_DETECTION) — 标注的数据格式。为 “coco_detection” 或 “coco_panoptic” 之一。 - do_convert_annotations (
bool, kwargs, optional, defaults toTrue) — 控制是否将标注转换为 RF_DETR 模型预期的格式。将边界框转换为(center_x, center_y, width, height)格式并归一化到[0, 1]范围内。可以通过preprocess方法中的do_convert_annotations参数进行覆盖。 - return_tensors (
str或 TensorType, optional) — 如果设置为'pt',则返回堆叠后的张量,否则返回张量列表。 - **kwargs (ImagesKwargs, optional) — 其他图像预处理选项。模型特定的 kwargs 列在上面;请参阅 TypedDict 类以获取支持参数的完整列表。
返回
~image_processing_base.BatchFeature
- data (
dict) — 由 call 方法返回的列表/数组/张量字典(“pixel_values”等)。 - tensor_type (
Union[None, str, TensorType], optional) — 您可以在此处提供 tensor_type 以在初始化时将整数列表转换为 PyTorch/Numpy 张量。
post_process_object_detection
< 源代码 >( outputs threshold: float = 0.5 target_sizes: transformers.utils.generic.TensorType | list[tuple] | None = None top_k: int | None = None ) → list[Dict]
将 RfDetrForObjectDetection 的原始输出转换为 (top_left_x, top_left_y, bottom_right_x, bottom_right_y) 格式的最终边界框。仅支持 PyTorch。
post_process_instance_segmentation
< 源码 >( outputs threshold: float = 0.5 mask_threshold: float = 0.0 target_sizes: list[tuple[int, int]] | None = None return_coco_annotation: bool = False return_binary_maps: bool = False top_k: int | None = None **kwargs ) → list[dict]
参数
- outputs ([RfDetrInstanceSegmentationOutput]) — 模型的原始输出。
- threshold (float, 可选, 默认为 0.5) — 保留预测实例掩码的分数阈值。
- mask_threshold (float, 可选, 默认为 0.0) — 二值化预测掩码的阈值。
- target_sizes (list[tuple[int, int]], 可选) — 每张图像的目标
(height, width)。如果未设置,掩码将不会被调整大小。 - return_coco_annotation (bool, 可选, 默认为 False) — 如果为 True,则将分割掩码作为 COCO 行程编码(RLE)返回,而不是张量。与 return_binary_maps 互斥。
- return_binary_maps (bool, 可选, 默认为 False) — 如果为 True,则将分割掩码作为堆叠的二值实例掩码张量(每个检测到的实例一个)返回,不进行重叠解析。这与原始
rfdetr包的输出格式一致。与 return_coco_annotation 互斥。 - top_k (int, 可选) — 分数阈值筛选前评估的最大候选查询数量。默认为查询总数。
返回
list[dict]
每张图像一个字典,包含以下键:
- segmentation —
int32分割 ID 的 Tensor[H, W](-1= 背景),当 return_binary_maps=True 时为布尔二值掩码的 Tensor[num_instances, H, W],或者当 return_coco_annotation=True 时为 RLE 编码列表。 - segments_info — 包含
id、label_id和score键的字典列表。
将 [RfDetrForInstanceSegmentation] 的输出转换为实例分割预测。
RfDetrModel
class transformers.RfDetrModel
< 源码 >( config: RfDetrConfig )
参数
- config (RfDetrConfig) — 具有模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,只会加载配置。查看 from_pretrained() 方法以加载模型权重。
纯 LW Detr 模型(由骨干网络和解码器 Transformer 组成),输出原始隐藏状态,顶部没有任何特定的检测头。
该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。
此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。
forward
< 源码 >( pixel_values: FloatTensor pixel_mask: torch.LongTensor | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) → RfDetrModelOutput 或 tuple(torch.FloatTensor)
参数
- pixel_values (
torch.FloatTensor,形状为(batch_size, num_channels, image_size, image_size)) — 对应于输入图像的张量。像素值可以使用 RfDetrImageProcessor 获取。有关详细信息,请参阅RfDetrImageProcessor.__call__()(processor_class使用 RfDetrImageProcessor 处理图像)。 - pixel_mask (
torch.LongTensor,形状为(batch_size, height, width),可选) — 用于避免对填充像素值执行注意力机制的掩码。掩码值在[0, 1]中选择:- 1 表示真实像素(即未被掩码),
- 0 表示填充像素(即被掩码)。
返回
RfDetrModelOutput 或 tuple(torch.FloatTensor)
RfDetrModelOutput 或 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置(RfDetrConfig)和输入,包含各种元素。
RF-DETR 模型的前向传播。流程如下:
- 从骨干网络的扁平化输出生成一组初始的对象查询嵌入和空间位置提案。
- 初始化用于精炼编码器阶段预测的存储空间(适应多组查询结构),并迭代精炼每组查询的对象查询及其坐标,以捕获编码器阶段中置信度最高的候选者。
- 初始化可学习的查询特征和空间参考点(推理时为了效率仅限于主组)。
- 在批次中投影基础参考点,使用预测的坐标偏移量进行精炼(在解码前将注意力转移到已发现的目标位置),并扩展目标查询特征以匹配批次维度。
- 将精炼后的查询和更新后的参考点通过解码器 Transformer,从多尺度特征中聚合详细的空间上下文。
last_hidden_state (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor, 可选,默认为None) — 模型最后一层输出的隐藏状态序列。init_reference_points (
torch.FloatTensor, 形状为(batch_size, num_queries, 4)) — 通过 Transformer 解码器发送的初始参考点。intermediate_hidden_states (
torch.FloatTensor,形状为(batch_size, config.decoder_layers, num_queries, d_model)) — 堆叠的中间隐藏状态(解码器每一层的输出)。intermediate_reference_points (
torch.FloatTensor, 形状为(batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间参考点(解码器每层的参考点)。enc_outputs_class (
torch.FloatTensorof shape(batch_size, sequence_length, config.num_labels), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 在第一阶段中,预测的边界框分数,其中得分最高的config.two_stage_num_proposals个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。enc_outputs_coord_logits (
torch.FloatTensorof shape(batch_size, sequence_length, 4), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 第一阶段中预测边界框坐标的对数。hidden_states (
tuple[torch.FloatTensor, ...],可选,当传递output_hidden_states=True或config.output_hidden_states=True时返回) —torch.FloatTensor的元组(如果模型有嵌入层,则第一个为嵌入输出,其余为每一层的输出),形状为(batch_size, sequence_length, hidden_size)。模型在每个层输出的隐藏状态以及可选的初始嵌入输出。
attentions (
tuple[torch.FloatTensor, ...],可选,当传递output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor的元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。注意力 softmax 后的注意力权重,用于计算自注意力头中的加权平均值。
cross_attentions (
tuple[torch.FloatTensor, ...], optional, 当传入output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。
backbone_features (
listoftorch.FloatTensor,形状为(batch_size, config.num_channels, config.image_size, config.image_size)) — 来自骨干网络的特征。
示例
>>> from transformers import AutoImageProcessor, RfDetrModel
>>> from PIL import Image
>>> import requests
>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> image = Image.open(requests.get(url, stream=True).raw)
>>> image_processor = AutoImageProcessor.from_pretrained("Roboflow/rf-detr-base")
>>> model = RfDetrModel.from_pretrained("Roboflow/rf-detr-base")
>>> inputs = image_processor(images=image, return_tensors="pt")
>>> outputs = model(**inputs)
>>> last_hidden_states = outputs.last_hidden_state
>>> list(last_hidden_states.shape)
[1, 200, 256]RfDetrForObjectDetection
class transformers.RfDetrForObjectDetection
< 源码 >( config: RfDetrConfig )
参数
- config (RfDetrConfig) — 具有模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,只会加载配置。查看 from_pretrained() 方法以加载模型权重。
LW DETR 模型(由骨干网络和解码器 Transformer 组成),顶部带有对象检测头,用于 COCO 检测等任务。
该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。
此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。
forward
< 源码 >( pixel_values: FloatTensor = None pixel_mask: torch.LongTensor | None = None labels: list[dict] | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) → RfDetrObjectDetectionOutput 或 tuple(torch.FloatTensor)
参数
- pixel_values (
torch.FloatTensor,形状为(batch_size, num_channels, image_size, image_size),可选) — 对应于输入图像的张量。像素值可以使用 RfDetrImageProcessor 获取。有关详细信息,请参阅RfDetrImageProcessor.__call__()(processor_class使用 RfDetrImageProcessor 处理图像)。 - pixel_mask (
torch.LongTensor,形状为(batch_size, height, width),可选) — 用于避免对填充像素值执行注意力机制的掩码。掩码值在[0, 1]中选择:- 1 表示真实像素(即未被掩码),
- 0 表示填充像素(即被掩码)。
- labels (
list[Dict], 长度为(batch_size,), 可选) — 用于计算二分匹配损失的标签。由字典组成的列表,每个字典至少包含以下 2 个键:‘class_labels’ 和 ‘boxes’(分别为批次中图像的类别标签和边界框)。类标签本身应为torch.LongTensor,长度为(图像中边界框的数量,),边界框应为torch.FloatTensor,形状为(图像中边界框的数量, 4)。
返回
RfDetrObjectDetectionOutput 或 tuple(torch.FloatTensor)
一个 RfDetrObjectDetectionOutput 或 torch.FloatTensor 的元组(如果传入 return_dict=False 或当 config.return_dict=False 时),根据配置(RfDetrConfig)和输入的不同,包含各种元素。
前向传播过程如下:
- 通过基础 RF-DETR 模型处理视觉输入,以获得 Transformer 的最后隐藏状态和参考点的最终序列。
- 第一阶段:从编码器提出的对象查询嵌入中生成分类逻辑值(logits)。
- 第二阶段:使用解码器的最后隐藏状态和最新的参考点预测最终分类标签和精细化后的边界框。
loss (
torch.FloatTensorof shape(1,), optional, 当提供labels时返回)) — 总损失,是类别预测的负对数似然(交叉熵)和边界框损失的线性组合。后者定义为 L1 损失和广义尺度不变 IoU 损失的线性组合。loss_dict (
Dict, 可选) — 包含各个损失的字典。用于日志记录。logits (形状为
(batch_size, num_queries, num_classes + 1)的torch.FloatTensor) — 所有查询的分类 logits(包括无对象)。pred_boxes (
torch.FloatTensor,形状为(batch_size, num_queries, 4)) — 所有查询的归一化框坐标,表示为 (center_x, center_y, width, height)。这些值相对于批次中每张图像的大小(忽略可能的填充)归一化在 [0, 1] 范围内。您可以使用~DeformableDetrProcessor.post_process_object_detection来检索非归一化的边界框。auxiliary_outputs (
list[Dict], optional) — 可选,仅在启用了辅助损失(即config.auxiliary_loss设置为True)且提供了标签时返回。它是一个字典列表,包含每个解码器层的上述两个键(logits和pred_boxes)。init_reference_points (
torch.FloatTensor, 形状为(batch_size, num_queries, 4)) — 通过 Transformer 解码器发送的初始参考点。last_hidden_state (形状为
(batch_size, sequence_length, hidden_size)的torch.FloatTensor, 可选,默认为None) — 模型最后一层输出的隐藏状态序列。intermediate_hidden_states (
torch.FloatTensor,形状为(batch_size, config.decoder_layers, num_queries, d_model)) — 堆叠的中间隐藏状态(解码器每一层的输出)。intermediate_reference_points (
torch.FloatTensor, 形状为(batch_size, config.decoder_layers, num_queries, 4)) — 堆叠的中间参考点(解码器每层的参考点)。enc_outputs_class (
torch.FloatTensorof shape(batch_size, sequence_length, config.num_labels), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 在第一阶段中,预测的边界框分数,其中得分最高的config.two_stage_num_proposals个边界框被选为区域提案。边界框二分类(即前景和背景)的输出。enc_outputs_coord_logits (
torch.FloatTensorof shape(batch_size, sequence_length, 4), optional, returned whenconfig.with_box_refine=Trueandconfig.two_stage=True) — 第一阶段中预测边界框坐标的对数。hidden_states (
tuple[torch.FloatTensor, ...],可选,当传递output_hidden_states=True或config.output_hidden_states=True时返回) —torch.FloatTensor的元组(如果模型有嵌入层,则第一个为嵌入输出,其余为每一层的输出),形状为(batch_size, sequence_length, hidden_size)。模型在每个层输出的隐藏状态以及可选的初始嵌入输出。
attentions (
tuple[torch.FloatTensor, ...],可选,当传递output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor的元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。注意力 softmax 后的注意力权重,用于计算自注意力头中的加权平均值。
cross_attentions (
tuple[torch.FloatTensor, ...], optional, 当传入output_attentions=True或config.output_attentions=True时返回) —torch.FloatTensor元组(每层一个),形状为(batch_size, num_heads, sequence_length, sequence_length)。解码器交叉注意力层的注意力权重,在注意力 softmax 之后,用于计算交叉注意力头中的加权平均。
backbone_features (
listoftorch.FloatTensor,形状为(batch_size, config.num_channels, config.image_size, config.image_size)) — 来自骨干网络的特征。
示例
>>> from transformers import AutoImageProcessor, RfDetrForObjectDetection
>>> from PIL import Image
>>> import requests
>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> image = Image.open(requests.get(url, stream=True).raw)
>>> image_processor = AutoImageProcessor.from_pretrained("Roboflow/rf-detr-base")
>>> model = RfDetrForObjectDetection.from_pretrained("Roboflow/rf-detr-base")
>>> inputs = image_processor(images=image, return_tensors="pt")
>>> outputs = model(**inputs)
>>> # convert outputs (bounding boxes and class logits) to Pascal VOC format (xmin, ymin, xmax, ymax)
>>> target_sizes = torch.tensor([image.size[::-1]])
>>> results = image_processor.post_process_object_detection(outputs, threshold=0.5, target_sizes=target_sizes)[
... 0
... ]
>>> for score, label, box in zip(results["scores"], results["labels"], results["boxes"]):
... box = [round(i, 2) for i in box.tolist()]
... print(
... f"Detected {model.config.id2label[label.item()]} with confidence "
... f"{round(score.item(), 3)} at location {box}"
... )
Detected cat with confidence 0.8 at location [16.5, 52.84, 318.25, 470.78]
Detected cat with confidence 0.789 at location [342.19, 24.3, 640.02, 372.25]
Detected remote with confidence 0.633 at location [40.79, 72.78, 176.76, 117.25]RfDetrForInstanceSegmentation
forward
< 源代码 >( pixel_values: FloatTensor = None pixel_mask: torch.LongTensor | None = None labels: list[dict] | None = None **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] )
参数
- pixel_values (
torch.FloatTensor,形状为(batch_size, num_channels, image_size, image_size),可选) — 对应于输入图像的张量。像素值可以使用 RfDetrImageProcessor 获取。详情请参阅RfDetrImageProcessor.__call__()(processor_class使用 RfDetrImageProcessor 来处理图像)。 - pixel_mask (
torch.LongTensor,形状为(batch_size, height, width),可选) — 用于避免对填充像素值执行注意力机制的掩码。掩码值选自[0, 1]:- 1 表示真实的像素(即未被遮罩),
- 0 表示填充像素(即已被遮罩)。
- labels (
list[Dict],长度为(batch_size,),可选) — 用于计算二分匹配损失的标签。由字典组成的列表,每个字典至少包含以下 2 个键:‘class_labels’ 和 ‘boxes’(分别为批次中图像的类别标签和边界框)。类标签本身应为torch.LongTensor,长度为(图像中边界框的数量,),边界框应为torch.FloatTensor,形状为(图像中边界框的数量, 4)。
用于实例分割的 RF-DETR 模型的前向传播。流程如下:
- 通过基础 RF-DETR 模型处理视觉输入,以获得多尺度空间特征、查询嵌入及其转换历史。
- 从编码器提出的对象查询嵌入中生成分类逻辑值和初始分割掩码(第一阶段)。
- 使用解码器的最后隐藏状态预测最终分类标签和精细化后的边界框(第二阶段)。
- 将高分辨率空间特征和查询隐藏状态通过分割头,以生成最终的、详细的实例掩码。
RfDetrDinov2Backbone
class transformers.RfDetrDinov2Backbone
< 源代码 >( config model_args: ~utils.generic.ModelArgs | None = None adapter_args: ~utils.generic.AdapterArgs | None = None lora_args: ~utils.generic.LoRAArgs | None = None tokenizer_args: ~utils.generic.TokenizerArgs | None = None dataset_args: ~utils.generic.DatasetArgs | None = None data_args: ~utils.generic.DataArgs | None = None training_args: ~utils.generic.TrainingArgs | None = None generation_args: ~utils.generic.GenerationArgs | None = None vision_tower_args: ~utils.generic.VisionTowerArgs | None = None qlora_args: ~utils.generic.QLoRAArgs | None = None vision_tower_template_args: ~utils.generic.VisionTowerTemplateArgs | None = None video_tower_args: ~utils.generic.VideoTowerArgs | None = None vision_config: ~utils.generic.VisionConfig | None = None video_config: ~utils.generic.VideoConfig | None = None load_dataset: bool | None = None load_data_collator: bool | None = None load_processor: bool | None = None load_lora_adapter: bool | None = None load_adapter: bool | None = None load_qlora_adapter: bool | None = None **kwargs: typing_extensions.Unpack[transformers.modeling_utils.PreTrainedModelKwargs] )
参数
- config (RfDetrDinov2Backbone) — 具有模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。
RfDetrDinov2 主干网络,可与 DETR 和 MaskFormer 等框架一起使用。
该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。
此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。
forward
< 源代码 >( pixel_values: Tensor **kwargs: typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs] ) → BackboneOutput 或 tuple(torch.FloatTensor)
参数
- pixel_values (
torch.Tensor,形状为(batch_size, num_channels, image_size, image_size)) — 对应于输入图像的张量。像素值可以使用 RfDetrImageProcessor 获取。详情请参阅RfDetrImageProcessor.__call__()(processor_class使用 RfDetrImageProcessor 来处理图像)。
返回
BackboneOutput 或 tuple(torch.FloatTensor)
一个 BackboneOutput 或 torch.FloatTensor 的元组(如果传入 return_dict=False 或当 config.return_dict=False 时),根据配置(RfDetrConfig)和输入的不同,包含各种元素。
RfDetrDinov2Backbone 的 forward 方法,重写了 __call__ 特殊方法。
虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用
Module实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。
feature_maps (
tuple(torch.FloatTensor)of shape(batch_size, num_channels, height, width)) — 阶段的特征图。hidden_states (
tuple(torch.FloatTensor), optional, returned whenoutput_hidden_states=Trueis passed or whenconfig.output_hidden_states=True) —torch.FloatTensor元组(一个用于嵌入输出 + 每个层输出一个)的形状为(batch_size, sequence_length, hidden_size)或(batch_size, num_channels, height, width),具体取决于主干网络。模型在每个阶段输出的隐藏状态以及初始嵌入输出。
attentions (
tuple(torch.FloatTensor), optional, returned whenoutput_attentions=Trueis passed or whenconfig.output_attentions=True) —torch.FloatTensor元组(每个层一个)的形状为(batch_size, num_heads, sequence_length, sequence_length)。仅当主干网络使用注意力时适用。注意力 softmax 后的注意力权重,用于计算自注意力头中的加权平均值。
示例
>>> from transformers import AutoImageProcessor, AutoBackbone
>>> import torch
>>> from PIL import Image
>>> import requests
>>> url = "http://images.cocodataset.org/val2017/000000039769.jpg"
>>> image = Image.open(requests.get(url, stream=True).raw)
>>> processor = AutoImageProcessor.from_pretrained("facebook/dinov2-base")
>>> model = AutoBackbone.from_pretrained(
... "facebook/dinov2-base", out_features=["stage2", "stage5", "stage8", "stage11"]
... )
>>> inputs = processor(image, return_tensors="pt")
>>> outputs = model(**inputs)
>>> feature_maps = outputs.feature_maps
>>> list(feature_maps[-1].shape)
[1, 768, 16, 16]