Sobes.tech
Middle

Ի՞նչ է CLIP-ի ճարտարապետությունը։

sobes.tech AI

Պատասխան AI-ից

CLIP (Contrastive Language–Image Pre-training) կառուցվածքը խորացված ուսուցման մոդել է, որը նախագծված է պատկերների և տեքստերի կապը ընդհանուր հատկությունների տարածքում կապելու համար:

Հիմնական բաղադրիչներ՝

  • Երկու կոդավորիչներ: մեկը պատկերների համար (հաճախ կոնվոլյուցիոն նեյրոնային ցանց կամ Vision Transformer), մյուսը տեքստի համար (transformer):
  • Կոնտրաստիվ ուսուցում: մոդելը սովորում է ճիշտ զուգակցել պատկերների և նկարագրությունների զույգերը՝ առավելագույնի հասցնելով նրանց միջև նմանությունը և նվազեցնելով անհամապատասխան զույգերը:

Սա թույլ է տալիս օգտագործել CLIP-ը այն խնդիրներում, որտեղ անհրաժեշտ է հասկանալ տեսողական տեղեկատվության և տեքստի միջև կապը, օրինակ՝ նկարների որոնում նկարագրության հիման վրա կամ նկարների համար նկարագրությունների սերունդ:

Օգտագործման օրինակ՝

import clip
import torch
from PIL import Image

մոդել, նախապատրաստում = clip.load("ViT-B/32")
պատկեր = նախապատրաստում(Image.open("example.jpg")).unsqueeze(0)
տեքստ = clip.tokenize(["մեկ կատու նկարը", "մեկ շուն նկարը"])

torch.no_grad() ի ժամանակ՝
    պատկերային հատկություններ = մոդել.encode_image(պատկեր)
    տեքստային հատկություններ = մոդել.encode_text(տեքստ)

    logits_per_image, logits_per_text = մոդել(պատկեր, տեքստ)
    հավանականություններ = logits_per_image.softmax(dim=-1)

print(հավանականություններ)  # Համապատասխանության հավանականություններ պատկերին և տեքստերին

CLIP-ը լայնորեն կիրառվում է բազմամոդալ հասկացողության և սերնդի խնդիրներում։