Sobes.tech
Middle

Co je to architektura CLIP?

sobes.tech AI

Odpověď od AI

Architektura CLIP (Contrastive Language–Image Pre-training) je model hlubokého učení navržený k propojení obrázků a textů v společném prostoru znaků.

Hlavní komponenty:

  • Dva enkodéry: jeden pro obrázky (obvykle konvoluční neuronová síť nebo Vision Transformer) a druhý pro text (transformer).
  • Kontrastivní učení: model se učí správně párovat obrázky a popisy, maximalizovat jejich podobnost a minimalizovat nesouvisející páry.

To umožňuje použití CLIP pro úkoly, kde je třeba pochopit vztah mezi vizuálními informacemi a textem, například vyhledávání obrázků podle popisu nebo generování popisů k obrázkům.

Příklad použití:

import clip
import torch
from PIL import Image

model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["fotografie kočky", "fotografie psa"])

with torch.no_grad():
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1)

print(probs)  # Pravděpodobnosti shody obrázku a textů

CLIP je široce používán v úlohách multimodálního porozumění a generování.