Sobes.tech
Senior

CLIP: fikir, itki funksiyası, təlim üsulu, nə üçün istifadə olunur. Embeddinglər arasındakı məsafə metrikləri hansılar ola bilər və müəlliflər hansıları tətbiq ediblər?

sobes.tech Süni İntellekt

AI-dan cavab

CLIP (Contrastive Language–Image Pre-training) OpenAI tərəfindən hazırlanmış və şəkil və mətn təsvirlərinin birgə öyrənilməsi üçün modeldir. Fikir odur ki, modelə şəkillər və onların mətn təsvirlərini ümumi gömmə (embedding) sahəsində uyğunlaşdırmağı öyrətmək.

Zərər funksiyası: istifadə olunan kontrastiv zərər (məsələn, InfoNCE), uyğun gələn "şəkil-mətn" cütlüklərinin gömmə təmsilçiləri arasındakı oxşarlığı maksimuma çatdırır və uyğun olmayan cütlüklərlə oxşarlığı minimuma endirir.

Təlim üsulu: model, şəkil və mətn üçün iki kodlayıcıdan istifadə etməklə böyük cütlüklər toplusunda öyrədilir. Təlim, əlaqəli cütlüklərin gömmə təmsilçilərinin yaxınlığını təşviq edən və əlaqəsizlərin ayırd edilməsini təmin edən kontrastiv zərər funksiyasını minimallaşdırmaq yolu ilə həyata keçirilir.

İstifadə: CLIP çoxmodlu axtarış tapşırıqları, əlavə təlim olmadan (zero-shot) şəkil təsnifatı, təsvirlərin yaradılması və vizual və mətn məlumatlarını əlaqələndirməli digər tapşırıqlar üçün tətbiq olunur.

Uzaqlıq metrikləri: gömmə təmsilçiləri arasındakı oxşarlığı ölçmək üçün adətən kosinus oxşarlığı, Evklid və ya Manhattan məsafəsi istifadə olunur. CLIP müəllifləri xüsusən kosinus oxşarlığını istifadə ediblər, çünki bu, vektorlar sahəsində istiqamətləri müqayisə etmək və vektorların uzunluğunu normallaşdırmaq üçün uyğundur.