Sobes.tech
Middle

¿Qué es la arquitectura CLIP?

sobes.tech AI

Respuesta de la IA

La arquitectura de CLIP (Contrastive Language–Image Pre-training) es un modelo de aprendizaje profundo desarrollado para vincular imágenes y textos en un espacio de características común.

Componentes principales:

  • Dos codificadores: uno para imágenes (generalmente una red neuronal convolucional o Vision Transformer), y otro para texto (transformer).
  • Aprendizaje contrastivo: el modelo aprende a emparejar correctamente las imágenes y las descripciones, maximizando la similitud entre ellos y minimizando la entre las no relacionadas.

Esto permite usar CLIP para tareas donde se necesita entender la relación entre información visual y texto, como búsqueda de imágenes por descripción o generación de descripciones para imágenes.

Ejemplo de uso:

import clip
import torch
from PIL import Image

model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["una foto de un gato", "una foto de un perro"])

with torch.no_grad():
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1)

print(probs)  # Probabilidades de correspondencia entre la imagen y los textos

CLIP se aplica ampliamente en tareas de comprensión y generación multimodal.