Middle
CLIP mimarisi nedir?
sobes.tech yapay zeka
AI'dan gelen yanıt
CLIP (Contrastive Language–Image Pre-training) mimarisi, görüntüleri ve metinleri ortak bir özellik alanında bağlamak üzere geliştirilmiş derin öğrenme modelidir.
Ana bileşenler:
- İki kodlayıcı: biri görüntüler için (genellikle konvolüsyonel sinir ağı veya Vision Transformer), diğeri metin için (transformer).
- Kontrastif öğrenme: model, doğru görüntü ve açıklama çiftlerini eşleştirmeyi öğrenir, aralarındaki benzerliği maksimize eder ve uyumsuzlar arasındaki benzerliği azaltır.
Bu, CLIP’in görsel bilgi ile metin arasındaki ilişkiyi anlaması gereken görevlerde kullanılmasını sağlar, örneğin açıklamaya göre görüntü arama veya görüntü açıklaması üretimi gibi.
Kullanım örneği:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["bir kedi fotoğrafı", "bir köpek fotoğrafı"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Görüntü ile metinlerin uyum olasılıkları
CLIP, çok modlu anlama ve üretim görevlerinde yaygın olarak kullanılmaktadır.