Middle
¿Qué es la arquitectura CLIP?
sobes.tech AI
Respuesta de la IA
La arquitectura de CLIP (Contrastive Language–Image Pre-training) es un modelo de aprendizaje profundo desarrollado para vincular imágenes y textos en un espacio de características común.
Componentes principales:
- Dos codificadores: uno para imágenes (generalmente una red neuronal convolucional o Vision Transformer), y otro para texto (transformer).
- Aprendizaje contrastivo: el modelo aprende a emparejar correctamente las imágenes y las descripciones, maximizando la similitud entre ellos y minimizando la entre las no relacionadas.
Esto permite usar CLIP para tareas donde se necesita entender la relación entre información visual y texto, como búsqueda de imágenes por descripción o generación de descripciones para imágenes.
Ejemplo de uso:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["una foto de un gato", "una foto de un perro"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Probabilidades de correspondencia entre la imagen y los textos
CLIP se aplica ampliamente en tareas de comprensión y generación multimodal.