Sobes.tech
Senior

CLIP: idee, kaotuse funktsioon, treeningmeetod, milleks kasutatakse. Milliseid kauguse mõõdikuid vahemikus embeddings saab kasutada ja milliseid kasutasid autorid?

sobes.tech AI

Vastus AI-lt

CLIP (Contrastive Language–Image Pre-training) on mudel, mille on välja töötanud OpenAI, et õppida koos pilte ja teksti esindusi. Idee on õpetada mudelil seostama pilte ja nende tekstikirjeldusi ühises sisestusruumis.

Kahju funktsioon: kasutatakse kontrastset kahju (näiteks InfoNCE), mis maksimeerib sarnasus "pilt-tekst" paaride sisestusruumides ning minimeerib mittesobivate paaride sarnasust.

Õppimisviis: mudelit treenitakse suure paari kogumi peal, kasutades kahte kodeerijat — piltidele ja tekstile. Treening toimub kontrastse kahju funktsiooni minimeerimise teel, mis soodustab seotud paaride sisestusruumide lähedust ning mitteseotud paaride eraldamist.

Kasutus: CLIP rakendub multimodaalse otsingu ülesannetele, piltide klassifitseerimisele ilma täiendava treeninguta (zero-shot), kirjelduste genereerimisele ja teistele ülesannetele, kus on vaja ühendada visuaalset ja tekstilist teavet.

Kaugusmõõtmed: sarnasuse mõõtmiseks kasutatakse tavaliselt kosinuslikku sarnasust, Euklidi või Manhattan kaugust. CLIP autorid on spetsiaalselt kasutanud kosinuslikku sarnasust, kuna see sobib hästi suundade võrdlemiseks vektori ruumis ning normaliseerib vektorite pikkust.