Middle
Mi az a CLIP architektúra?
sobes.tech MI
Válasz az MI-től
A CLIP (Contrastive Language–Image Pre-training) architektúra egy mélytanulási modell, amelyet arra fejlesztettek ki, hogy képeket és szövegeket kapcsoljon össze egy közös jellemzőtérben.
Fő összetevők:
- Két kódoló: egy képekhez (általában konvolúciós neurális háló vagy Vision Transformer), és egy szöveghez (transformer).
- Kontrasztív tanulás: a modell megtanulja helyesen párosítani a képek és leírások párosításait, maximalizálva azok hasonlóságát, miközben minimalizálja a nem megfelelő párokat.
Ez lehetővé teszi a CLIP használatát olyan feladatokban, ahol szükség van a vizuális információ és a szöveg közötti kapcsolat megértésére, például képek keresése leírás alapján vagy képekhez tartozó leírások generálása.
Használati példa:
import clip
import torch
from PIL import Image
model, preprocess = clip.load("ViT-B/32")
image = preprocess(Image.open("example.jpg")).unsqueeze(0)
text = clip.tokenize(["egy macska képe", "egy kutya képe"])
with torch.no_grad():
image_features = model.encode_image(image)
text_features = model.encode_text(text)
logits_per_image, logits_per_text = model(image, text)
probs = logits_per_image.softmax(dim=-1)
print(probs) # A kép és a szövegek közötti megfelelőség valószínűségei
A CLIP széles körben alkalmazott multimodális megértési és generációs feladatokban.