Sobes.tech
Senior

Ce este OWL-ViT?

sobes.tech AI

Răspuns de la AI

OWL-ViT (Open-World Learning Vision Transformer) este un model care combină capacitățile de procesare a imaginilor și textului pentru rezolvarea sarcinilor de înțelegere multimodală. Este bazat pe arhitectura Vision Transformer (ViT) și este destinat pentru o lume deschisă, adică poate recunoaște și lega obiecte și concepte care nu au fost explicit prezente în setul de date de antrenament.

Ideea principală a OWL-ViT este utilizarea modelelor mari de limbaj și a transformatoarelor pentru a lega caracteristicile vizuale de descrierile textuale, ceea ce permite modelului să efectueze sarcini precum căutarea de obiecte în imagine pe baza unei interogări textuale, clasificarea cu un set deschis de clase și generarea de descrieri.

Exemplu de aplicație: căutarea de obiecte într-o imagine printr-o interogare textuală, chiar dacă obiectul nu a fost anterior cunoscut de model.