Middle
Qu'est-ce que l'architecture CLIP?
sobes.tech IA
Réponse de l'IA
L’architecture CLIP (Contrastive Language–Image Pre-training) est un modèle d’apprentissage profond conçu pour relier les images et les textes dans un espace de caractéristiques commun.
Composants principaux:
- Deux encodeurs : un pour les images (généralement un réseau neuronal convolutif ou Vision Transformer), et un pour le texte (transformer).
- Apprentissage contrastif : le modèle apprend à associer correctement les paires d’images et de descriptions, en maximisant la similarité entre eux et en minimisant celle entre les non-correspondants.
Cela permet d’utiliser CLIP pour des tâches où il faut comprendre la relation entre l’information visuelle et le texte, comme la recherche d’images par description ou la génération de descriptions pour des images.
Exemple d’utilisation:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["une photo d’un chat", "une photo d’un chien"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Probabilités de correspondance entre l’image et les textes
CLIP est largement utilisé dans les tâches de compréhension et de génération multimodale.