Sobes.tech
Senior

CLIP: fikir, kayıp fonksiyonu, eğitim yöntemi, ne için kullanılır. Embeddingler arasındaki mesafe ölçütleri nelerdir ve yazarlar hangilerini kullandı?

sobes.tech yapay zeka

AI'dan gelen yanıt

CLIP (Contrastive Language–Image Pre-training), OpenAI tarafından geliştirilen ve görüntü ile metin temsillerinin ortak eğitimini sağlayan bir modeldir. Fikir, modeli, görüntüleri ve bunların metin açıklamalarını ortak bir gömme alanında eşleştirmeyi öğretmektir.

Kayıp fonksiyonu: karşılaştırmalı bir kayıp (örneğin, InfoNCE) kullanılır, bu da "görüntü-metni" çiftlerinin birbirine uygun gömme temsilleri arasındaki benzerliği maksimize eder ve uygun olmayan çiftlerle benzerliği minimize eder.

Eğitim yöntemi: model, görüntüler ve metinler için iki kodlayıcı kullanılarak büyük bir çift kümesi üzerinde eğitilir. Eğitim, ilişkili çiftlerin gömme temsillerinin yakınlığını teşvik eden ve ilgisiz gömme temsillerini ayıran karşılaştırmalı bir kayıp fonksiyonunun minimize edilmesiyle gerçekleşir.

Kullanım: CLIP, çok modlu arama görevleri, ek eğitim olmadan görüntü sınıflandırma (sıfır-atış), açıklama üretimi ve görsel ile metinsel bilgileri bağlaması gereken diğer görevler için uygulanır.

Uzaklık metrikleri: gömme temsilleri arasındaki benzerliği ölçmek için genellikle kosinüs benzerliği, Öklid uzaklığı veya Manhattan uzaklığı kullanılır. CLIP yazarları özellikle kosinüs benzerliğini kullanmışlardır, çünkü bu, vektör uzayındaki yönleri karşılaştırmak ve vektörlerin uzunluğunu normalize etmek için uygundur.