Sobes.tech
Middle

Kas ir CLIP arhitektūra?

sobes.tech AI

Atbilde no AI

CLIP (Contrastive Language–Image Pre-training) arhitektūra ir dziļās mācīšanās modelis, kas izstrādāts, lai saistītu attēlus un tekstus kopīgā raksturlielumu telpā.

Galvenās sastāvdaļas:

  • Divi kodētāji: viens attēliem (parasti konvolucionāls neironu tīkls vai Vision Transformer), otrs tekstiem (transformers).
  • Kontrastīvā mācīšanās: modelis māca pareizi saskaņot attēlu un aprakstu pārus, maksimizējot to līdzību un minimizējot nesaskaņotos pārus.

Tas ļauj izmantot CLIP uzdevumos, kur ir nepieciešama vizuālās informācijas un teksta izpratne, piemēram, attēlu meklēšana pēc apraksta vai aprakstu ģenerēšana attēliem.

Piemērs lietošanai:

import clip
import torch
from PIL import Image

model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["kaķa foto", "suņa foto"])

with torch.no_grad():
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1)

print(probs)  # Varbūtības, ka attēls atbilst tekstiem

CLIP plaši tiek izmantots daudzmodalu sapratnes un ģenerēšanas uzdevumos.