CLIP: идея, жоготуучу функция, үйрөнүү ыкмасы, эмне үчүн колдонулат. Эмбеддингдердин ортосундагы аралык метрикалар кайсыларды колдонсо болот жана авторлор кайсыларын колдонушкан?
sobes.tech AI
AIден жооп
CLIP (Contrastive Language–Image Pre-training) modeli, ki OpenAI tomonidan ishlab chiqilgan, rasm va matn tasvirlarini umumiy o‘rganish uchun mo‘ljallangan. G‘oya shundan iboratki, modelga rasm va ularning matn tavsiflarini umumiy embedding bo‘shlig‘ida moslashtirishni o‘rgatish.
Yo‘qotish funktsiyasi: kontrastiv yo‘qotish (masalan, InfoNCE) ishlatiladi, bu mos keladigan "rasm-matn" juftliklarining embeddinglari o‘rtasidagi o‘xshashlikni maksimal qilish va mos kelmaydigan juftliklar bilan o‘xshashlikni minimallashtirish.
O‘qitish usuli: model, rasm va matn uchun ikki kodlovchi yordamida katta juftliklar to‘plamida o‘qitiladi. O‘qitish, bog‘langan juftliklarning embeddinglari yaqinligini va bog‘lanmaganlarning ajralishini rag‘batlantiradigan kontrastiv yo‘qotish funktsiyasini minimallashtirish orqali amalga oshiriladi.
Qo‘llanilishi: CLIP multimodal qidiruv, rasm tasnifi uchun qo‘shimcha o‘qitishsiz (zero-shot), tavsiflar yaratish va vizual va matnli ma’lumotlarni bog‘lash kerak bo‘lgan boshqa vazifalar uchun qo‘llaniladi.
Masofa o‘lchovlari: odatda, kosinus o‘xshashligi, Evklid yoki Manhattan masofasi ishlatiladi. CLIP mualliflari ayniqsa, kosinus o‘xshashligini ishlatishgan, chunki bu vektorlar yo‘nalishlarini taqqoslash uchun mos va vektorlarning uzunligini normallashtiradi.