Middle
CLIP memarlığı nədir?
sobes.tech Süni İntellekt
AI-dan cavab
CLIP (Contrastive Language–Image Pre-training) memarlığı, şəkilləri və mətnləri ümumi xüsusiyyətlər sahəsində əlaqələndirmək üçün hazırlanmış dərin öyrənmə modelidir.
Əsas komponentlər:
- İki kodlayıcı: biri şəkillər üçün (adətən konvolyusiya neyron şəbəkəsi və ya Vision Transformer), digəri mətn üçün (transformer).
- Kontrastiv öyrənmə: model düzgün şəkil və təsvir cütlərini uyğunlaşdırmağı öyrənir, onların oxşarlığını maksimuma çatdırır və uyğun olmayanlar arasında minimuma endirir.
Bu, CLIP-in vizual məlumat və mətn arasındakı əlaqəni anlamaqda istifadə olunmasına imkan verir, məsələn, təsvirə görə şəkil axtarışı və ya şəkillər üçün təsvirlərin yaradılması kimi.
İstifadə nümunəsi:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["bir pişik şəkli", "bir it şəkli"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Şəkil və mətnlər arasındakı uyğunluq ehtimalları
CLIP çox modalli anlayış və nəsil tapşırıqlarında geniş istifadə olunur.