Sobes.tech
Senior

Mi az az OWL-ViT?

sobes.tech MI

Válasz az MI-től

OWL-ViT (Open-World Learning Vision Transformer) egy olyan modell, amely ötvözi a képek és szövegek feldolgozásának képességeit a multimodális megértési feladatok megoldására. A Vision Transformer (ViT) architektúrára épül, és nyitott világra tervezték, vagyis képes felismerni és összekapcsolni azokat a tárgyakat és fogalmakat, amelyek nem voltak kifejezetten jelen a tanulási adathalmazban.

Az OWL-ViT fő ötlete nagy nyelvi modellek és transzformátorok használata a vizuális jellemzők szöveges leírásokkal való összekapcsolására, ami lehetővé teszi a modell számára, hogy olyan feladatokat hajtson végre, mint az objektumkeresés képeken szöveges lekérdezésekkel, nyitott osztálykészlettel történő osztályozás és leírások generálása.

Alkalmazási példa: objektumok keresése képen szöveges kérés alapján, még akkor is, ha az objektumot a modell korábban nem ismerte.