CLIP: idea, funzione di perdita, metodo di addestramento, a cosa serve. Quali metriche di distanza tra gli embedding si possono usare e quali hanno applicato gli autori?
sobes.tech AI
Risposta dell'AI
CLIP (Contrastive Language–Image Pre-training) è un modello sviluppato da OpenAI per l'apprendimento congiunto delle rappresentazioni di immagini e testo. L'idea è insegnare al modello ad associare immagini e le loro descrizioni testuali in uno spazio di embedding comune.
Funzione di perdita: si utilizza una perdita contrastiva (ad esempio, InfoNCE), che massimizza la somiglianza tra gli embedding di coppie "immagine-test" corrispondenti e minimizza la somiglianza con coppie non corrispondenti.
Modo di addestramento: il modello viene addestrato su un grande insieme di coppie (immagine, didascalia) utilizzando due codificatori — per le immagini e per il testo. L'addestramento avviene minimizzando una funzione di perdita contrastiva, che favorisce la vicinanza degli embedding delle coppie collegate e la separazione di quelli non collegati.
Utilizzo: CLIP viene applicato a compiti di ricerca multimodale, classificazione di immagini senza addestramento aggiuntivo (zero-shot), generazione di descrizioni e altri compiti che richiedono di collegare informazioni visive e testuali.
Metriche di distanza: per misurare la somiglianza tra gli embedding, si utilizza generalmente la somiglianza coseno, la distanza euclidea o la distanza di Manhattan. Gli autori di CLIP hanno usato specificamente la somiglianza coseno, poiché è adatta per confrontare direzioni nello spazio vettoriale e normalizza la lunghezza dei vettori.