Middle
Wat is de architectuur van CLIP?
sobes.tech AI
Antwoord van AI
De architectuur van CLIP (Contrastive Language–Image Pre-training) is een diepgaand leermodel ontwikkeld om beelden en teksten in een gemeenschappelijke kenmerkenruimte te koppelen.
Belangrijkste componenten:
- Twee encoders: één voor beelden (meestal een convolutioneel neuraal netwerk of Vision Transformer), en één voor tekst (transformer).
- Contrastief leren: het model leert correcte koppelingen tussen beeld- en tekstparen, waarbij het de overeenkomst maximaliseert en de niet-overeenkomende minimaliseert.
Dit stelt CLIP in staat om te worden gebruikt voor taken waarbij het begrijpen van de relatie tussen visuele informatie en tekst nodig is, zoals beeldzoekopdrachten op basis van beschrijvingen of het genereren van beschrijvingen voor beelden.
Voorbeeld van gebruik:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["een foto van een kat", "een foto van een hond"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Waarschijnlijkheden van overeenstemming tussen afbeelding en teksten
CLIP wordt veel gebruikt in multimodale begrip- en generatietaken.