Sobes.tech
Middle

CLIP memarlığı nədir?

sobes.tech Süni İntellekt

AI-dan cavab

CLIP (Contrastive Language–Image Pre-training) memarlığı, şəkilləri və mətnləri ümumi xüsusiyyətlər sahəsində əlaqələndirmək üçün hazırlanmış dərin öyrənmə modelidir.

Əsas komponentlər:

  • İki kodlayıcı: biri şəkillər üçün (adətən konvolyusiya neyron şəbəkəsi və ya Vision Transformer), digəri mətn üçün (transformer).
  • Kontrastiv öyrənmə: model düzgün şəkil və təsvir cütlərini uyğunlaşdırmağı öyrənir, onların oxşarlığını maksimuma çatdırır və uyğun olmayanlar arasında minimuma endirir.

Bu, CLIP-in vizual məlumat və mətn arasındakı əlaqəni anlamaqda istifadə olunmasına imkan verir, məsələn, təsvirə görə şəkil axtarışı və ya şəkillər üçün təsvirlərin yaradılması kimi.

İstifadə nümunəsi:

import clip
import torch
from PIL import Image

model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["bir pişik şəkli", "bir it şəkli"])

with torch.no_grad():
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1)

print(probs)  # Şəkil və mətnlər arasındakı uyğunluq ehtimalları

CLIP çox modalli anlayış və nəsil tapşırıqlarında geniş istifadə olunur.