CLIP: idee, kaotuse funktsioon, treeningmeetod, milleks kasutatakse. Milliseid kauguse mõõdikuid vahemikus embeddings saab kasutada ja milliseid kasutasid autorid?
sobes.tech AI
Vastus AI-lt
CLIP (Contrastive Language–Image Pre-training) on mudel, mille on välja töötanud OpenAI, et õppida koos pilte ja teksti esindusi. Idee on õpetada mudelil seostama pilte ja nende tekstikirjeldusi ühises sisestusruumis.
Kahju funktsioon: kasutatakse kontrastset kahju (näiteks InfoNCE), mis maksimeerib sarnasus "pilt-tekst" paaride sisestusruumides ning minimeerib mittesobivate paaride sarnasust.
Õppimisviis: mudelit treenitakse suure paari kogumi peal, kasutades kahte kodeerijat — piltidele ja tekstile. Treening toimub kontrastse kahju funktsiooni minimeerimise teel, mis soodustab seotud paaride sisestusruumide lähedust ning mitteseotud paaride eraldamist.
Kasutus: CLIP rakendub multimodaalse otsingu ülesannetele, piltide klassifitseerimisele ilma täiendava treeninguta (zero-shot), kirjelduste genereerimisele ja teistele ülesannetele, kus on vaja ühendada visuaalset ja tekstilist teavet.
Kaugusmõõtmed: sarnasuse mõõtmiseks kasutatakse tavaliselt kosinuslikku sarnasust, Euklidi või Manhattan kaugust. CLIP autorid on spetsiaalselt kasutanud kosinuslikku sarnasust, kuna see sobib hästi suundade võrdlemiseks vektori ruumis ning normaliseerib vektorite pikkust.