Sobes.tech
Senior

Mis on OWL-ViT?

sobes.tech AI

Vastus AI-lt

OWL-ViT (Open-World Learning Vision Transformer) on mudel, mis ühendab pildi- ja tekstitöötlusvõimalused mitmemodaalse mõistmise ülesannete lahendamiseks. See põhineb Vision Transformer (ViT) arhitektuuril ja on mõeldud avatud maailmale, see tähendab, et see suudab tuvastada ja seostada objekte ja kontseptsioone, mis polnud selgelt esindatud treeningandmekogus.

OWL-ViT peamine idee on kasutada suuri keelemudeleid ja transformaatoreid, et ühendada visuaalsed tunnused tekstikirjeldustega, võimaldades mudelil täita ülesandeid nagu objektide otsimine pildil teksti päringute kaudu, avatud klasside kogumiga klassifitseerimine ja kirjelduste genereerimine.

Rakenduse näide: objektide otsimine pildil teksti päringuga, isegi kui objekt polnud mudelile varem teada.