Transformers 文档

RegNet

Hugging Face's logo
加入 Hugging Face 社区

并获得增强的文档体验

开始使用

该模型于 2020 年 3 月 30 日发表在 HF papers 上,并于 2022 年 4 月 7 日贡献给 Hugging Face Transformers。

RegNet

概述

RegNet 模型由 Ilija Radosavovic、Raj Prateek Kosaraju、Ross Girshick、Kaiming He 和 Piotr Dollár 在 《Designing Network Design Spaces》 一文中提出。

作者设计了搜索空间以执行神经架构搜索 (NAS)。他们首先从一个高维搜索空间开始,通过根据当前搜索空间采样的表现最佳的模型经验性地应用约束,迭代地缩小搜索空间。

论文摘要如下:

在这项工作中,我们提出了一种新的网络设计范式。我们的目标是帮助提升对网络设计的理解,并发现能够跨环境泛化的设计原则。我们没有专注于设计单个网络实例,而是设计了参数化网络群体的网络设计空间。整个过程类似于传统的网络手动设计,但提升到了设计空间层面。使用我们的方法,我们探索了网络设计的结构方面,并得到了一个由简单的、规则的网络组成的低维设计空间,我们称之为 RegNet。RegNet 参数化的核心洞察力出奇地简单:优秀网络的宽度和深度可以用量化的线性函数来解释。我们分析了 RegNet 设计空间,并得出了一些与当前网络设计实践不符的有趣发现。RegNet 设计空间提供了简单且快速的网络,这些网络在广泛的触发器(flop)体制下都能很好地工作。在可比较的训练设置和触发器下,RegNet 模型优于流行的 EfficientNet 模型,同时在 GPU 上速度最高快 5 倍。

此模型由 Francesco 贡献。原始代码可以在 这里 找到。

来自 《Self-supervised Pretraining of Visual Features in the Wild》 的巨大 10B 模型,该模型在 10 亿张 Instagram 图片上进行了训练,可在 hub 上获取。

资源

一份官方 Hugging Face 和社区(以 🌎 表示)资源列表,帮助您开始使用 RegNet。

图像分类

如果您有兴趣在此处提交资源,请随时开启 Pull Request,我们将对其进行审查!该资源最好能展示一些新内容,而不是重复现有资源。

RegNetConfig

class transformers.RegNetConfig

< >

( transformers_version: str | None = None architectures: list[str] | None = None output_hidden_states: bool | None = False return_dict: bool | None = True dtype: typing.Union[str, ForwardRef('torch.dtype'), NoneType] = None chunk_size_feed_forward: int = 0 is_encoder_decoder: bool = False id2label: dict[int, str] | dict[str, str] | None = None label2id: dict[str, int] | dict[str, str] | None = None problem_type: typing.Optional[typing.Literal['regression', 'single_label_classification', 'multi_label_classification']] = None num_channels: int = 3 embedding_size: int = 32 hidden_sizes: list[int] | tuple[int, ...] = (128, 192, 512, 1088) depths: list[int] | tuple[int, ...] = (2, 6, 12, 2) groups_width: int = 64 layer_type: str = 'y' hidden_act: str = 'relu' downsample_in_first_stage: bool = True )

参数

  • num_channels (int, 可选, 默认为 3) — 输入通道数。
  • embedding_size (int, 可选, 默认为 32) — 嵌入和隐藏状态的维度。
  • hidden_sizes (Union[list[int], tuple[int, ...]], 可选, 默认为 (128, 192, 512, 1088)) — 模型每个阶段的维度(隐藏大小)。
  • depths (Union[list[int], tuple[int, ...]], 可选, 默认为 (2, 6, 12, 2)) — Transformer 中每层的深度。
  • groups_width (int, 可选, 默认为 64) — 每个阶段的组宽度。
  • layer_type (str, 可选, 默认为 "y") — 要使用的层类型,可以是 "x""y"x 层是 ResNet 的 BottleNeck 层,其 reduction 固定为 1。而 y 层是 x 层加上挤压和激励 (squeeze and excitation)。请参阅论文以获取有关这些层如何构建的详细说明。
  • hidden_act (str, 可选, 默认为 relu) — 解码器中的非线性激活函数(函数或字符串)。例如:"gelu""relu""silu" 等。
  • downsample_in_first_stage (bool, 可选, 默认为 False) — 如果设为 True,第一阶段将使用步长为 2 的 stride 对输入进行下采样。

这是用于存储 RegNetModel 配置的配置类。它根据指定的参数实例化一个 RegNet 模型,从而定义模型架构。使用默认值实例化配置将产生与 facebook/regnet-y-040 类似的配置。

配置对象继承自 PreTrainedConfig,可用于控制模型输出。阅读 PreTrainedConfig 的文档以获取更多信息。

示例

>>> from transformers import RegNetConfig, RegNetModel

>>> # Initializing a RegNet regnet-y-40 style configuration
>>> configuration = RegNetConfig()
>>> # Initializing a model from the regnet-y-40 style configuration
>>> model = RegNetModel(configuration)
>>> # Accessing the model configuration
>>> configuration = model.config

RegNetModel

class transformers.RegNetModel

< >

( config model_args: ~utils.generic.ModelArgs | None = None adapter_args: ~utils.generic.AdapterArgs | None = None lora_args: ~utils.generic.LoRAArgs | None = None tokenizer_args: ~utils.generic.TokenizerArgs | None = None dataset_args: ~utils.generic.DatasetArgs | None = None data_args: ~utils.generic.DataArgs | None = None training_args: ~utils.generic.TrainingArgs | None = None generation_args: ~utils.generic.GenerationArgs | None = None vision_tower_args: ~utils.generic.VisionTowerArgs | None = None qlora_args: ~utils.generic.QLoRAArgs | None = None vision_tower_template_args: ~utils.generic.VisionTowerTemplateArgs | None = None video_tower_args: ~utils.generic.VideoTowerArgs | None = None vision_config: ~utils.generic.VisionConfig | None = None video_config: ~utils.generic.VideoConfig | None = None load_dataset: bool | None = None load_data_collator: bool | None = None load_processor: bool | None = None load_lora_adapter: bool | None = None load_adapter: bool | None = None load_qlora_adapter: bool | None = None **kwargs: typing_extensions.Unpack[transformers.modeling_utils.PreTrainedModelKwargs] )

参数

  • config (RegNetModel) — 包含模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。

裸 RegNet 模型,输出原始隐藏状态,顶部没有任何特定头部。

该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。

此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。

forward

< >

( pixel_values: Tensor output_hidden_states: bool | None = None return_dict: bool | None = None **kwargs ) BaseModelOutputWithPoolingAndNoAttentiontuple(torch.FloatTensor)

参数

  • pixel_values (torch.Tensor,形状为 (batch_size, num_channels, image_size, image_size)) — 对应于输入图像的张量。可以使用 ConvNextImageProcessor 获取像素值。详情请参阅 ConvNextImageProcessor.__call__()processor_class 使用 ConvNextImageProcessor 处理图像)。
  • output_hidden_states (bool, 可选) — 是否返回所有层的隐藏状态。有关详细信息,请参阅返回张量下的 hidden_states
  • return_dict (bool, 可选) — 是否返回 ModelOutput 而不是普通元组。

返回

BaseModelOutputWithPoolingAndNoAttentiontuple(torch.FloatTensor)

一个 BaseModelOutputWithPoolingAndNoAttention,或者是一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置 (RegNetConfig) 和输入包含各种元素。

RegNetModel 的前向传播方法,覆盖了 __call__ 特殊方法。

虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用 Module 实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。

  • last_hidden_state (torch.FloatTensor, 形状为 (batch_size, num_channels, height, width)) — 模型最后一层输出的隐藏状态序列。

  • pooler_output (torch.FloatTensor, 形状为 (batch_size, hidden_size)) — 经过空间维度池化操作后的最后一层隐藏状态。

  • hidden_states (tuple(torch.FloatTensor), optional, 当传入 output_hidden_states=Trueconfig.output_hidden_states=True 时返回) — torch.FloatTensor 的元组(如果模型有嵌入层,则包含一个嵌入层输出,加上每层的一个输出),形状为 (batch_size, num_channels, height, width)

    模型在每个层输出的隐藏状态以及可选的初始嵌入输出。

示例

RegNetForImageClassification

class transformers.RegNetForImageClassification

< >

( config model_args: ~utils.generic.ModelArgs | None = None adapter_args: ~utils.generic.AdapterArgs | None = None lora_args: ~utils.generic.LoRAArgs | None = None tokenizer_args: ~utils.generic.TokenizerArgs | None = None dataset_args: ~utils.generic.DatasetArgs | None = None data_args: ~utils.generic.DataArgs | None = None training_args: ~utils.generic.TrainingArgs | None = None generation_args: ~utils.generic.GenerationArgs | None = None vision_tower_args: ~utils.generic.VisionTowerArgs | None = None qlora_args: ~utils.generic.QLoRAArgs | None = None vision_tower_template_args: ~utils.generic.VisionTowerTemplateArgs | None = None video_tower_args: ~utils.generic.VideoTowerArgs | None = None vision_config: ~utils.generic.VisionConfig | None = None video_config: ~utils.generic.VideoConfig | None = None load_dataset: bool | None = None load_data_collator: bool | None = None load_processor: bool | None = None load_lora_adapter: bool | None = None load_adapter: bool | None = None load_qlora_adapter: bool | None = None **kwargs: typing_extensions.Unpack[transformers.modeling_utils.PreTrainedModelKwargs] )

参数

  • config (RegNetForImageClassification) — 包含模型所有参数的模型配置类。使用配置文件初始化不会加载与模型相关的权重,仅加载配置。请查看 from_pretrained() 方法以加载模型权重。

带有图像分类头的 RegNet 模型(在汇聚特征之上添加一个线性层),例如用于 ImageNet。

该模型继承自 PreTrainedModel。请查看超类文档以了解该库为所有模型实现的通用方法(例如下载或保存、调整输入嵌入大小、剪枝头部等)。

此模型也是一个 PyTorch torch.nn.Module 子类。像普通的 PyTorch Module 一样使用它,并参考 PyTorch 文档了解一般用法和行为的所有相关信息。

forward

< >

( pixel_values: torch.FloatTensor | None = None labels: torch.LongTensor | None = None output_hidden_states: bool | None = None return_dict: bool | None = None **kwargs ) ImageClassifierOutputWithNoAttentiontuple(torch.FloatTensor)

参数

  • pixel_values (torch.FloatTensor,形状为 (batch_size, num_channels, image_size, image_size)可选) — 对应于输入图像的张量。可以使用 ConvNextImageProcessor 获取像素值。详情请参阅 ConvNextImageProcessor.__call__()processor_class 使用 ConvNextImageProcessor 处理图像)。
  • labels (torch.LongTensor,形状为 (batch_size,)可选) — 用于计算图像分类/回归损失的标签。索引应在 [0, ..., config.num_labels - 1] 范围内。如果 config.num_labels > 1,则计算分类损失(交叉熵)。
  • output_hidden_states (bool, 可选) — 是否返回所有层的隐藏状态。有关详细信息,请参阅返回张量下的 hidden_states
  • return_dict (bool, 可选) — 是否返回 ModelOutput 而不是普通元组。

返回

ImageClassifierOutputWithNoAttentiontuple(torch.FloatTensor)

一个 ImageClassifierOutputWithNoAttention,或者是一个 torch.FloatTensor 元组(如果传递了 return_dict=False 或当 config.return_dict=False 时),根据配置 (RegNetConfig) 和输入包含各种元素。

RegNetForImageClassification 的前向传播方法,覆盖了 __call__ 特殊方法。

虽然 forward pass 的实现需要在此函数中定义,但你应该在之后调用 Module 实例而不是这个,因为前者负责运行预处理和后处理步骤,而后者会静默地忽略它们。

  • loss (形状为 (1,)torch.FloatTensor可选,当提供 labels 时返回) — 分类损失(如果 config.num_labels==1,则为回归损失)。
  • logits (形状为 (batch_size, config.num_labels)torch.FloatTensor) — 分类(如果 config.num_labels==1,则为回归)分数(SoftMax 之前)。
  • hidden_states (tuple(torch.FloatTensor), optional, 当传入 output_hidden_states=Trueconfig.output_hidden_states=True 时返回) — torch.FloatTensor 的元组(如果模型有嵌入层,则包含一个嵌入层输出,加上每阶段的一个输出),形状为 (batch_size, num_channels, height, width)。模型在每个阶段输出的隐藏状态(也称为特征图)。

示例

>>> from transformers import AutoImageProcessor, RegNetForImageClassification
>>> import torch
>>> from datasets import load_dataset

>>> dataset = load_dataset("huggingface/cats-image")
>>> image = dataset["test"]["image"][0]

>>> image_processor = AutoImageProcessor.from_pretrained("facebook/regnet-y-040")
>>> model = RegNetForImageClassification.from_pretrained("facebook/regnet-y-040")

>>> inputs = image_processor(image, return_tensors="pt")

>>> with torch.no_grad():
...     logits = model(**inputs).logits

>>> # model predicts one of the 1000 ImageNet classes
>>> predicted_label = logits.argmax(-1).item()
>>> print(model.config.id2label[predicted_label])
...
在 GitHub 上更新

© . This site is unofficial and not affiliated with Hugging Face, Inc.