Sobes.tech
Middle

Czym jest architektura CLIP?

sobes.tech AI

Odpowiedź od AI

Architektura CLIP (Contrastive Language–Image Pre-training) to model głębokiego uczenia się opracowany do łączenia obrazów i tekstów w wspólnej przestrzeni cech.

Główne komponenty:

  • Dwa enkodery: jeden dla obrazów (zwykle konwolucyjna sieć neuronowa lub Vision Transformer), drugi dla tekstu (transformer).
  • Uczenie kontrastowe: model uczy się poprawnego dopasowywania par obrazów i opisów, maksymalizując podobieństwo między nimi i minimalizując je między niepasującymi.

Umożliwia to użycie CLIP w zadaniach, gdzie konieczne jest zrozumienie związku między informacją wizualną a tekstem, np. wyszukiwanie obrazów na podstawie opisu lub generowanie opisów obrazów.

Przykład użycia:

import clip
import torch
from PIL import Image

model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["zdjęcie kota", "zdjęcie psa"])

with torch.no_grad():
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1)

print(probs)  # Prawdopodobieństwa dopasowania obrazu do tekstów

CLIP jest szeroko stosowany w zadaniach rozumienia i generowania multimodalnego.