Middle
Was ist die CLIP-Architektur?
sobes.tech KI
Antwort von AI
Die Architektur von CLIP (Contrastive Language–Image Pre-training) ist ein Deep-Learning-Modell, das entwickelt wurde, um Bilder und Texte in einem gemeinsamen Merkmalsraum zu verbinden.
Hauptkomponenten:
- Zwei Encoder: einer für Bilder (normalerweise ein konvolutionales neuronales Netzwerk oder Vision Transformer) und einer für Texte (Transformer).
- Kontrastives Lernen: Das Modell lernt, die richtigen Paare von Bildern und Beschreibungen zuzuordnen, indem es die Ähnlichkeit maximiert und die Nicht-Übereinstimmungen minimiert.
Dies ermöglicht die Verwendung von CLIP für Aufgaben, bei denen die Beziehung zwischen visuellen Informationen und Text verstanden werden muss, z.B. Bildsuche anhand von Beschreibungen oder Generierung von Bildbeschreibungen.
Anwendungsbeispiel:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["ein Foto von einer Katze", "ein Foto von einem Hund"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Wahrscheinlichkeiten für die Übereinstimmung des Bildes mit den Texten
CLIP wird breit in multimodalen Verständnis- und Generierungsaufgaben eingesetzt.