Sobes.tech
Senior

CLIP : idée, fonction de perte, méthode d'apprentissage, à quoi cela sert-il ? Quelles métriques de distance entre embeddings peuvent être utilisées et lesquelles ont été utilisées par les auteurs ?

sobes.tech IA

Réponse de l'IA

CLIP (Contrastive Language–Image Pre-training) est un modèle développé par OpenAI pour l’apprentissage conjoint des représentations d’images et de texte. L’idée est d’apprendre au modèle à associer des images et leurs descriptions textuelles dans un espace d’embedding commun.

Fonction de perte : une perte contrastive (par exemple, InfoNCE) est utilisée, qui maximise la similarité entre les embeddings de paires "image-texte" correspondantes, et minimise la similarité avec des paires non correspondantes.

Méthode d’apprentissage : le modèle est entraîné sur un grand ensemble de paires (image, légende) à l’aide de deux encodeurs — pour les images et pour le texte. L’entraînement consiste à minimiser une fonction de perte contrastive, qui encourage la proximité des embeddings des paires liées et la séparation des embeddings non liées.

Utilisation : CLIP est utilisé pour des tâches de recherche multimodale, de classification d’images sans entraînement supplémentaire (zero-shot), de génération de descriptions et d’autres tâches où il faut relier des informations visuelles et textuelles.

Métriques de distance : pour mesurer la similarité entre embeddings, on utilise généralement la similarité cosinus, la distance euclidienne ou la distance de Manhattan. Les auteurs de CLIP ont utilisé spécifiquement la similarité cosinus, car elle est adaptée pour comparer des directions dans l’espace vectoriel et normalise la longueur des vecteurs.