Class Token Pooling
CLS Token
Image Patches
Patch Embedding
Vision Transformer (ViT)
BEiT
DeiT (Data-efficient Image Transformer)
Hybrid CNN-Transformer
Shifted Windows
Swin Transformer
ALIGN
BYOL
CLIP
DINO (Self-Supervised)
DINOv2
Masked Autoencoder (MAE)
MoCo
OpenCLIP
No terms or links match your search.