Middle
Ce este arhitectura CLIP?
sobes.tech AI
Răspuns de la AI
Arhitectura CLIP (Contrastive Language–Image Pre-training) este un model de învățare profundă dezvoltat pentru a lega imaginile și textele într-un spațiu comun de caracteristici.
Componente principale:
- Doi codificatori: unul pentru imagini (de obicei o rețea neuronală convoluțională sau Vision Transformer), și unul pentru text (transformer).
- Învățare contrastivă: modelul învață să potrivească corect perechile de imagini și descrieri, maximizând similitudinea dintre ele și minimizând cea între cele necorespunzătoare.
Aceasta permite utilizarea CLIP pentru sarcini în care trebuie înțeleasă legătura dintre informația vizuală și text, cum ar fi căutarea de imagini după descriere sau generarea de descrieri pentru imagini.
Exemplu de utilizare:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["o fotografie cu o pisică", "o fotografie cu un câine"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Probabilități de potrivire între imagine și texte
CLIP este utilizat pe scară largă în sarcini de înțelegere și generare multimodală.