Transformers 文档
DiT
开始使用
基类
模型
预处理器
推理
Pipeline API
生成 API
优化
与模型聊天
服务
训练
量化
生态系统集成
资源
API
主要类别
模型
文本模型
视觉模型
Aimv2BEiTBiTCHMv2条件 DETRConvNeXTConvNeXTV2CvTD-FINEDAB-DETR可变形 DETRDEIMv2DeiTDepth AnythingDepth Anything V2DepthProDETRDiNATDINOV2DINOv2 with RegistersDINOv3DiTDPTEfficientLoFTREfficientNetEoMTEoMT-DINOv3FocalNetGLPNHGNet-V2HieraI-JEPAImageGPTLeViTLightGlueLW-DETRMask2FormerMaskFormerMLCDMobileNetV1MobileNetV2MobileViTMobileViTV2PixioPoolFormerPrompt Depth AnythingPyramid Vision Transformer (PVT)Pyramid Vision Transformer v2 (PVTv2)RegNetResNetRF-DETRRT-DETRRT-DETRv2SAM2Sam3TrackerSapiens2SegFormerSegGptSegment AnythingSegment Anything High QualitySuperGlueSuperPointSwiftFormerSwin TransformerSwin Transformer V2Swin2SRTable TransformerTextNetTimm WrapperUperNetUVDocVidEoMTVision Transformer (ViT)ViTDetViTMAEViTMatteViTMSNViTPoseYOLOSZoeDepth
音频模型
视频模型
多模态模型
强化学习模型
时间序列模型
内部帮助程序
参考
加入 Hugging Face 社区
并获得增强的文档体验
开始使用
该模型于 2022-03-04 发表在 HF papers 上,并于 2022-03-10 贡献给 Hugging Face Transformers。
DiT
DiT 是一种在大规模未标记文档图像上进行预训练的图像 Transformer。它学习从受损的输入图像中预测缺失的视觉 token。预训练的 DiT 模型可以用作其他模型的骨干网络(backbone),以执行诸如文档图像分类和表格检测等视觉文档任务。
您可以在 Microsoft 组织下找到所有原始的 DiT 检查点(checkpoints)。
请参考 BEiT 文档以获取更多关于如何将 DiT 应用于不同视觉任务的示例。
下面的示例演示了如何使用 Pipeline 或 AutoModel 类来对图像进行分类。
流水线
自动模型
from transformers import pipeline
pipeline = pipeline(
task="image-classification",
model="microsoft/dit-base-finetuned-rvlcdip",
device=0
)
pipeline("https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/transformers/model_doc/dit-example.jpg")注意事项
预训练的 DiT 权重可以在 [BEiT] 模型中加载,并配备一个建模头(modeling head)来预测视觉 token。
from transformers import BeitForMaskedImageModeling model = BeitForMaskedImageModeling.from_pretraining("microsoft/dit-base")
资源
- 请参考此 notebook 以获取文档图像分类推理示例。