Sobes.tech
Middle

Was ist die CLIP-Architektur?

sobes.tech KI

Antwort von AI

Die Architektur von CLIP (Contrastive Language–Image Pre-training) ist ein Deep-Learning-Modell, das entwickelt wurde, um Bilder und Texte in einem gemeinsamen Merkmalsraum zu verbinden.

Hauptkomponenten:

  • Zwei Encoder: einer für Bilder (normalerweise ein konvolutionales neuronales Netzwerk oder Vision Transformer) und einer für Texte (Transformer).
  • Kontrastives Lernen: Das Modell lernt, die richtigen Paare von Bildern und Beschreibungen zuzuordnen, indem es die Ähnlichkeit maximiert und die Nicht-Übereinstimmungen minimiert.

Dies ermöglicht die Verwendung von CLIP für Aufgaben, bei denen die Beziehung zwischen visuellen Informationen und Text verstanden werden muss, z.B. Bildsuche anhand von Beschreibungen oder Generierung von Bildbeschreibungen.

Anwendungsbeispiel:

import clip
import torch
from PIL import Image

model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["ein Foto von einer Katze", "ein Foto von einem Hund"])

with torch.no_grad():
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1)

print(probs)  # Wahrscheinlichkeiten für die Übereinstimmung des Bildes mit den Texten

CLIP wird breit in multimodalen Verständnis- und Generierungsaufgaben eingesetzt.