Sobes.tech
Middle

Mis on CLIP arhitektuur?

sobes.tech AI

Vastus AI-lt

CLIP (Contrastive Language–Image Pre-training) arhitektuur on süvaõppimise mudel, mis on loodud ühendama pilte ja tekste ühises tunnuste ruumis.

Peamised komponendid:

  • Kaks kodeerijat: üks piltidele (tavaliselt konvolutsiooniline närvivõrk või Vision Transformer) ja teine tekstidele (transformer).
  • Kontrastne õpe: mudel õpib õigesti sobitama pildipaarid ja kirjeldused, maksimeerides nende sarnasust ja minimeerides mittesobivate paare.

See võimaldab CLIP-i kasutada ülesannetes, kus on vaja mõista visuaalse teabe ja teksti vahelist seost, näiteks pildiotsing kirjelduse järgi või kirjelduste genereerimine piltidele.

Kasutusnäide:

import clip
import torch
from PIL import Image

model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["kassi foto", "koera foto"])

with torch.no_grad():
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1)

print(probs)  # Tõenäosused pildi ja teksti sobivusele

CLIP on laialdaselt kasutusel multimodaalse mõistmise ja generatsiooni ülesannetes.