Middle
Mis on CLIP arhitektuur?
sobes.tech AI
Vastus AI-lt
CLIP (Contrastive Language–Image Pre-training) arhitektuur on süvaõppimise mudel, mis on loodud ühendama pilte ja tekste ühises tunnuste ruumis.
Peamised komponendid:
- Kaks kodeerijat: üks piltidele (tavaliselt konvolutsiooniline närvivõrk või Vision Transformer) ja teine tekstidele (transformer).
- Kontrastne õpe: mudel õpib õigesti sobitama pildipaarid ja kirjeldused, maksimeerides nende sarnasust ja minimeerides mittesobivate paare.
See võimaldab CLIP-i kasutada ülesannetes, kus on vaja mõista visuaalse teabe ja teksti vahelist seost, näiteks pildiotsing kirjelduse järgi või kirjelduste genereerimine piltidele.
Kasutusnäide:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["kassi foto", "koera foto"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # Tõenäosused pildi ja teksti sobivusele
CLIP on laialdaselt kasutusel multimodaalse mõistmise ja generatsiooni ülesannetes.