Senior
OWL-ViT nedir?
sobes.tech yapay zeka
AI'dan gelen yanıt
OWL-ViT (Open-World Learning Vision Transformer), görsel ve metin işleme yeteneklerini birleştiren ve çok modlu anlayış görevlerini çözmek için tasarlanmış bir modeldir. Vision Transformer (ViT) mimarisine dayanır ve açık dünya için tasarlanmıştır, yani eğitim kümesinde açıkça temsil edilmeyen nesne ve kavramları tanıyabilir ve bağlayabilir.
OWL-ViT’nin temel fikri, büyük dil modelleri ve dönüştürücüleri kullanarak görsel özellikleri metin açıklamalarıyla bağlamaktır, bu da modelin görüntüde nesne arama, açık sınıf kümesiyle sınıflandırma ve açıklama üretimi gibi görevleri yerine getirmesini sağlar.
Uygulama örneği: metin sorgusu ile görüntüde nesne arama, nesne önceden model tarafından bilinmese bile.