Transformers 文档

DiT

Hugging Face's logo
加入 Hugging Face 社区

并获得增强的文档体验

开始使用

该模型于 2022-03-04 发表在 HF papers 上,并于 2022-03-10 贡献给 Hugging Face Transformers。

DiT

DiT 是一种在大规模未标记文档图像上进行预训练的图像 Transformer。它学习从受损的输入图像中预测缺失的视觉 token。预训练的 DiT 模型可以用作其他模型的骨干网络(backbone),以执行诸如文档图像分类和表格检测等视觉文档任务。

您可以在 Microsoft 组织下找到所有原始的 DiT 检查点(checkpoints)。

请参考 BEiT 文档以获取更多关于如何将 DiT 应用于不同视觉任务的示例。

下面的示例演示了如何使用 PipelineAutoModel 类来对图像进行分类。

流水线
自动模型
from transformers import pipeline


pipeline = pipeline(
    task="image-classification",
    model="microsoft/dit-base-finetuned-rvlcdip",
    device=0
)
pipeline("https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/transformers/model_doc/dit-example.jpg")

注意事项

  • 预训练的 DiT 权重可以在 [BEiT] 模型中加载,并配备一个建模头(modeling head)来预测视觉 token。

    from transformers import BeitForMaskedImageModeling
    
    model = BeitForMaskedImageModeling.from_pretraining("microsoft/dit-base")

资源

  • 请参考此 notebook 以获取文档图像分类推理示例。
在 GitHub 上更新

© . This site is unofficial and not affiliated with Hugging Face, Inc.