Middle
Co je to architektura CLIP?
sobes.tech AI
Odpověď od AI
Architektura CLIP (Contrastive Language–Image Pre-training) je model hlubokého učení navržený k propojení obrázků a textů v společném prostoru znaků.
Hlavní komponenty:
- Dva enkodéry: jeden pro obrázky (obvykle konvoluční neuronová síť nebo Vision Transformer) a druhý pro text (transformer).
- Kontrastivní učení: model se učí správně párovat obrázky a popisy, maximalizovat jejich podobnost a minimalizovat nesouvisející páry.
To umožňuje použití CLIP pro úkoly, kde je třeba pochopit vztah mezi vizuálními informacemi a textem, například vyhledávání obrázků podle popisu nebo generování popisů k obrázkům.
Příklad použití:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["fotografie kočky", "fotografie psa"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Pravděpodobnosti shody obrázku a textů
CLIP je široce používán v úlohách multimodálního porozumění a generování.