Sobes.tech
Middle

რა არის CLIP-ის არქიტექტურა?

sobes.tech AI

პასუხი AI-სგან

CLIP (Contrastive Language–Image Pre-training) არქიტექტურა არის ღრმა სწავლების მოდელი, რომელიც შექმნილია გამოსახულებების და ტექსტების დაკავშირებისთვის საერთო თვისებების სივრცეში.

ძირითადი კომპონენტები:

  • ორი კოდეკატორი: ერთი გამოსახულებებისთვის (საშუალოდ კონვოლუციური ნეირონული ქსელი ან Vision Transformer), მეორე ტექსტისთვის (transformer).
  • კონტრასტიული სწავლება: მოდელი სწავლობს სწორად შეათავსოს გამოსახულებების და აღწერილობების წყვილები, მაქსიმალურად გაზარდოს მათ შორის მსგავსება და მინიმუმამდე დაიყვანოს არასწორი წყვილები.

ეს საშუალებას აძლევს გამოიყენოს CLIP იმ დავალებებში, სადაც საჭიროა ვიზუალური ინფორმაციის და ტექსტის ურთიერთობის გაგება, მაგალითად, გამოსახულებების ძიება აღწერის მიხედვით ან გამოსახულებებისთვის აღწერილობების გენერირება.

გამოყენების მაგალითი:

import clip
import torch
from PIL import Image

მოდელი, preprocess = clip.load("ViT-B/32")
გამოსახულება = preprocess(Image.open("example.jpg")).unsqueeze(0)
ტექსტი = clip.tokenize(["კატას ფოტო", "ძაღლის ფოტო"])

torch.no_grad() შიგნით:
    გამოსახულების თვისებები = მოდელი.encode_image(გამოსახულება)
    ტექსტის თვისებები = მოდელი.encode_text(ტექსტი)

    logits_per_image, logits_per_text = მოდელი(გამოსახულება, ტექსტი)
    ალბათობები = logits_per_image.softmax(dim=-1)

print(ალბათობები)  # შესაბამისობის ალბათობები გამოსახულებას და ტექსტებს

CLIP ფართოდ გამოიყენება მრავალმოდალური გაგებისა და გენერაციის დავალებებში.