Middle
CLIP arxitekturasi nima?
sobes.tech AI
AIdan javob
CLIP (Contrastive Language–Image Pre-training) arxitekturasi chuqur o‘qitish modeli bo‘lib, u rasm va matnlarni umumiy xususiyatlar bo‘shlig‘ida bog‘laydi.
Asosiy komponentlar:
- Ikki kodlayıcı: biri rasm uchun (odatda konvolyutsion neyron tarmoq yoki Vision Transformer), ikkinchisi matn uchun (transformer).
- Konkastiv o‘qitish: model to‘g‘ri rasm va tavsiflar juftligini moslashtirishni o‘rganadi, ular orasidagi o‘xshashlikni maksimalga chiqaradi va mos kelmaydiganlar orasida minimalga tushiradi.
Bu CLIPni vizual ma’lumotlar va matn o‘rtasidagi bog‘liqlikni tushunish kerak bo‘lgan vazifalarda, masalan, tavsifga asoslangan rasm qidiruvi yoki rasm uchun tavsiflar yaratishda foydalanishga imkon beradi.
Foydalanish misoli:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["bir mushuk rasmi", "bir it rasmi"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Rasm va matnlar o‘rtasidagi moslik ehtimollari
CLIP ko‘p modalli tushunish va generatsiya vazifalarida keng qo‘llaniladi.