Sobes.tech
Middle

Čo je architektúra CLIP?

sobes.tech AI

Odpoveď od AI

Architektúra CLIP (Contrastive Language–Image Pre-training) je model hlbokého učenia navrhnutý na spojenie obrázkov a textov v spoločnom priestore znakov.

Hlavné komponenty:

  • Dva enkodéry: jeden pre obrázky (zvyčajne konvolučná neurónová sieť alebo Vision Transformer) a druhý pre text (transformer).
  • Kontrastívne učenie: model sa učí správne spájať páry obrázkov a popisov, maximalizujúc ich podobnosť a minimalizujúc nesúvisiace páry.

Toto umožňuje použitie CLIP v úlohách, kde je potrebné pochopiť vzťah medzi vizuálnymi informáciami a textom, napríklad vyhľadávanie obrázkov podľa popisu alebo generovanie popisov k obrázkom.

Príklad použitia:

import clip
import torch
from PIL import Image

model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["fotografia mačky", "fotografia psa"])

with torch.no_grad():
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1)

print(probs)  # Pravdepodobnosti zhodnosti obrázka a textov

CLIP sa široko používa v úlohách multimodálneho porozumenia a generovania.