Middle
Čo je architektúra CLIP?
sobes.tech AI
Odpoveď od AI
Architektúra CLIP (Contrastive Language–Image Pre-training) je model hlbokého učenia navrhnutý na spojenie obrázkov a textov v spoločnom priestore znakov.
Hlavné komponenty:
- Dva enkodéry: jeden pre obrázky (zvyčajne konvolučná neurónová sieť alebo Vision Transformer) a druhý pre text (transformer).
- Kontrastívne učenie: model sa učí správne spájať páry obrázkov a popisov, maximalizujúc ich podobnosť a minimalizujúc nesúvisiace páry.
Toto umožňuje použitie CLIP v úlohách, kde je potrebné pochopiť vzťah medzi vizuálnymi informáciami a textom, napríklad vyhľadávanie obrázkov podľa popisu alebo generovanie popisov k obrázkom.
Príklad použitia:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["fotografia mačky", "fotografia psa"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Pravdepodobnosti zhodnosti obrázka a textov
CLIP sa široko používa v úlohách multimodálneho porozumenia a generovania.