Sobes.tech
Senior

Co je OWL-ViT?

sobes.tech AI

Odpověď od AI

OWL-ViT (Open-World Learning Vision Transformer) je model, ktorý kombinuje schopnosti spracovania obrázkov a textu na riešenie úloh multimodálneho porozumenia. Je založený na architektúre Vision Transformer (ViT) a je určený pre otvorený svet, teda je schopný rozpoznávať a spájať objekty a koncepty, ktoré neboli explicitne zastúpené v tréningovej sade.

Hlavná myšlienka OWL-ViT je využívanie veľkých jazykových modelov a transformerov na spájanie vizuálnych znakov s textovými popismi, čo umožňuje modelu vykonávať úlohy ako vyhľadávanie objektov na obrázku pomocou textových dopytov, klasifikáciu s otvoreným súborom tried a generovanie popisov.

Príklad použitia: vyhľadávanie objektov na obrázku pomocou textového dopytu, aj keď objekt nebol modelom vopred známy.