Sobes.tech
Middle

CLIP архитектурасы эмне?

sobes.tech AI

AIден жооп

CLIP (Contrastive Language–Image Pre-training) архитектурасы терең үйрөнүү моделдери болуп саналат, ал сүрөттөрдү жана тексттерди жалпы өзгөчөлүк кеңейтигинде байланыштыруу үчүн иштелип чыккан.

Негизги компоненттер:

  • Эки коддоочу: бири сүрөттөр үчүн (адатта конволюциондук нейрондук тармак же Vision Transformer), экинчиси текст үчүн (transformer).
  • Контрастивдүү үйрөнүү: модел туура сүрөт жана сүрөттөмөлөрдүн парларын шайкеш келтирүүнү үйрөнөт, алардын окшоштугун максималдаштырып жана туура эмес парларды минималдаштырат.

Бул CLIPти визуалдык маалымат жана текст ортосундагы байланышты түшүнүү керек болгон тапшырмаларда колдонууга мүмкүндүк берет, мисалы, сүрөттөрдү сүрөттөмө боюнча издөө же сүрөттөргө сүрөттөмөлөрдү түзүү.

Колдонуу мисалы:

import clip
import torch
from PIL import Image

model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["бир мысык сүрөтү", "бир ит сүрөтү"])

torch.no_grad() ичинде:
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1)

print(probs)  # сүрөт жана тексттердин шайкештигинин мүмкүнчүлүктөрү

CLIP кеңири колдонулат көпмодалдуу түшүнүү жана генерация тапшырмаларында.