Sobes.tech
Senior

Kas yra OWL-ViT?

sobes.tech AI

Atsakymas iš AI

OWL-ViT (Open-World Learning Vision Transformer) yra modelis, jungiantis vaizdų ir teksto apdorojimo galimybes sprendžiant daugiamodalinio supratimo užduotis. Jis pagrįstas Vision Transformer (ViT) architektūra ir skirtas atviro pasaulio užduotims, tai yra, jis gali atpažinti ir susieti objektus bei sąvokas, kurios nebuvo aiškiai pateiktos mokymo rinkinyje.

Pagrindinė OWL-ViT idėja yra naudoti didelius kalbinius modelius ir transformatorius, kad sujungtų vizualines savybes su tekstiniais aprašymais, leidžiant modeliui atlikti užduotis, tokias kaip objektų paieška vaizde pagal teksto užklausas, atviro klasių rinkinio klasifikavimas ir aprašymų generavimas.

Pavyzdys: objektų paieška vaizde pagal teksto užklausą, net jei objektas anksčiau nebuvo žinomas modeliui.