Middle
Czym jest architektura CLIP?
sobes.tech AI
Odpowiedź od AI
Architektura CLIP (Contrastive Language–Image Pre-training) to model głębokiego uczenia się opracowany do łączenia obrazów i tekstów w wspólnej przestrzeni cech.
Główne komponenty:
- Dwa enkodery: jeden dla obrazów (zwykle konwolucyjna sieć neuronowa lub Vision Transformer), drugi dla tekstu (transformer).
- Uczenie kontrastowe: model uczy się poprawnego dopasowywania par obrazów i opisów, maksymalizując podobieństwo między nimi i minimalizując je między niepasującymi.
Umożliwia to użycie CLIP w zadaniach, gdzie konieczne jest zrozumienie związku między informacją wizualną a tekstem, np. wyszukiwanie obrazów na podstawie opisu lub generowanie opisów obrazów.
Przykład użycia:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["zdjęcie kota", "zdjęcie psa"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Prawdopodobieństwa dopasowania obrazu do tekstów
CLIP jest szeroko stosowany w zadaniach rozumienia i generowania multimodalnego.