Sobes.tech
Senior

OWL-ViT эмне?

sobes.tech AI

AIден жооп

OWL-ViT (Open-World Learning Vision Transformer) modeli, ki kombineer vizualne in besedilne zmogljivosti za reševanje nalog multimodalnega razumevanja. Temelji na arhitekturi Vision Transformer (ViT) in je zasnovan za odprti svet, torej je sposoben prepoznati in povezati predmete in koncepte, ki niso bili jasno predstavljeni v učnem naboru podatkov.

Glavna ideja OWL-ViT je uporaba velikih jezikovnih modelov in transformerjev za povezovanje vizualnih značilnosti z besedilnimi opisi, kar omogoča modelu izvajanje nalog, kot so iskanje predmetov na sliki s pomočjo besedilnih poizvedb, razvrščanje z odprtim naborom razredov in generiranje opisov.

Primer uporabe: iskanje predmetov na sliki s pomočjo besedilne poizvedbe, tudi če predmet ni bil vnaprej znan modelu.