CLIP: ideja, funkcija gubitka, metoda obuke, za šta se koristi. Koje metrike udaljenosti između embeddinga se mogu koristiti i koje su koristili autori?
sobes.tech АИ
Одговор од АИ
CLIP (Contrastive Language–Image Pre-training) je model koji je razvio OpenAI za zajedničko učenje prikaza slika i teksta. Ideja je da nauči model da poveže slike i njihove tekstualne opise u zajednički prostor ugradnje.
Funkcija gubitka: koristi se kontrastivni gubitak (npr. InfoNCE), koji maksimizira sličnost između ugradnji parova "slika-tekst" koji odgovaraju i minimizira sličnost sa nepovezanim parovima.
Način učenja: model se trenira na velikom skupu parova (slika, opis) pomoću dva enkodera — za slike i za tekst. Učenje se vrši minimiziranjem kontrastivne funkcije gubitka, koja podstiče blizinu ugradnji povezanih parova i razdvajanje nepovezanih.
Upotreba: CLIP se primenjuje za zadatke višemodalnog pretraživanja, klasifikacije slika bez dodatnog učenja (zero-shot), generisanja opisa i drugih zadataka gde je potrebno povezati vizuelne i tekstualne informacije.
Metrike udaljenosti: za merenje sličnosti između ugradnji, obično se koristi kosinusna sličnost, Evklidska ili Manhattan distanca. Autori CLIP-a su posebno koristili kosinusnu sličnost, jer je pogodna za poređenje pravaca u vektorskom prostoru i normalizuje dužinu vektora.