Sobes.tech
Middle

Mi az a CLIP architektúra?

sobes.tech MI

Válasz az MI-től

A CLIP (Contrastive Language–Image Pre-training) architektúra egy mélytanulási modell, amelyet arra fejlesztettek ki, hogy képeket és szövegeket kapcsoljon össze egy közös jellemzőtérben.

Fő összetevők:

  • Két kódoló: egy képekhez (általában konvolúciós neurális háló vagy Vision Transformer), és egy szöveghez (transformer).
  • Kontrasztív tanulás: a modell megtanulja helyesen párosítani a képek és leírások párosításait, maximalizálva azok hasonlóságát, miközben minimalizálja a nem megfelelő párokat.

Ez lehetővé teszi a CLIP használatát olyan feladatokban, ahol szükség van a vizuális információ és a szöveg közötti kapcsolat megértésére, például képek keresése leírás alapján vagy képekhez tartozó leírások generálása.

Használati példa:

import clip
import torch
from PIL import Image

model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["egy macska képe", "egy kutya képe"])

with torch.no_grad():
    image_features = model.encode_image(image)
    text_features = model.encode_text(text)

    logits_per_image, logits_per_text = model(image, text)
    probs = logits_per_image.softmax(dim=-1)

print(probs)  # A kép és a szövegek közötti megfelelőség valószínűségei

A CLIP széles körben alkalmazott multimodális megértési és generációs feladatokban.