Sobes.tech
Middle

Маъзулоти архитектураи CLIP чист?

sobes.tech AI

Ҷавоб аз AI

Архитектураи CLIP (Contrastive Language–Image Pre-training) моделҳои амиқи омӯзиш мебошанд, ки барои пайваст кардани тасвирҳо ва матнҳо дар фазои умумии хусусиятҳо таҳия шудаанд.

Компонентҳои асосӣ:

  • Ду кодекатор: яке барои тасвирҳо (одатан як нейронӣ конволютсионӣ ё Vision Transformer) ва дигар барои матн (transformer).
  • Омӯзиши муқоисавӣ: модел меомӯзад, ки дуҷуфтҳои тасвир ва тавсифро дуруст пайваст кунад, ҳангоми баланд бардоштани мувофиқат ва кам кардани номувофиқат.

Ин имкон медиҳад, ки CLIP дар вазифаҳое истифода шавад, ки дар онҳо фаҳмидани робитаи байни маълумоти визуалӣ ва матн зарур аст, масалан, ҷустуҷӯи тасвирҳо бо тавсиф ё эҷоди тавсифҳо барои тасвирҳо.

Маслиҳат барои истифода:

import clip
import torch
from PIL import Image

model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["расми як гург", "расми як саг"])

with torch.no_grad():
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1)

print(probs)  # Имкониятҳои мувофиқат байни тасвир ва матнҳо

CLIP дар вазифаҳое, ки ба фаҳмидани мултимодалӣ ва эҷод кардани маълумотҳо дахл доранд, васеъ истифода мешавад.