Image Embedding Models
Image embedding models are often called vision encoders or feature extractors.
Some examples of industry standard vision encoders are:
- CLIP (Contrastive Language-Image Pretraining)
- Vision Transformers (ViT)
- ResNet (Residual Networks) that uses CNNs