Middle
Ի՞նչ է CLIP-ի ճարտարապետությունը։
sobes.tech AI
Պատասխան AI-ից
CLIP (Contrastive Language–Image Pre-training) կառուցվածքը խորացված ուսուցման մոդել է, որը նախագծված է պատկերների և տեքստերի կապը ընդհանուր հատկությունների տարածքում կապելու համար:
Հիմնական բաղադրիչներ՝
- Երկու կոդավորիչներ: մեկը պատկերների համար (հաճախ կոնվոլյուցիոն նեյրոնային ցանց կամ Vision Transformer), մյուսը տեքստի համար (transformer):
- Կոնտրաստիվ ուսուցում: մոդելը սովորում է ճիշտ զուգակցել պատկերների և նկարագրությունների զույգերը՝ առավելագույնի հասցնելով նրանց միջև նմանությունը և նվազեցնելով անհամապատասխան զույգերը:
Սա թույլ է տալիս օգտագործել CLIP-ը այն խնդիրներում, որտեղ անհրաժեշտ է հասկանալ տեսողական տեղեկատվության և տեքստի միջև կապը, օրինակ՝ նկարների որոնում նկարագրության հիման վրա կամ նկարների համար նկարագրությունների սերունդ:
Օգտագործման օրինակ՝
import clip
import torch
from PIL import Image
մոդել, նախապատրաստում = clip.load("ViT-B/32")
պատկեր = նախապատրաստում(Image.open("example.jpg")).unsqueeze(0)
տեքստ = clip.tokenize(["մեկ կատու նկարը", "մեկ շուն նկարը"])
torch.no_grad() ի ժամանակ՝
պատկերային հատկություններ = մոդել.encode_image(պատկեր)
տեքստային հատկություններ = մոդել.encode_text(տեքստ)
logits_per_image, logits_per_text = մոդել(պատկեր, տեքստ)
հավանականություններ = logits_per_image.softmax(dim=-1)
print(հավանականություններ) # Համապատասխանության հավանականություններ պատկերին և տեքստերին
CLIP-ը լայնորեն կիրառվում է բազմամոդալ հասկացողության և սերնդի խնդիրներում։