Sobes.tech
Senior

Cos'è OWL-ViT?

sobes.tech AI

Risposta dell'AI

OWL-ViT (Open-World Learning Vision Transformer) è un modello che combina capacità di elaborazione di immagini e testo per risolvere compiti di comprensione multimodale. Si basa sull’architettura Vision Transformer (ViT) ed è progettato per un mondo aperto, cioè in grado di riconoscere e collegare oggetti e concetti che non erano esplicitamente presenti nel set di dati di addestramento.

L’idea principale di OWL-ViT è utilizzare grandi modelli linguistici e trasformatori per collegare le caratteristiche visive con le descrizioni testuali, consentendo al modello di eseguire compiti come la ricerca di oggetti in immagini tramite query testuali, classificazione con un insieme aperto di classi e generazione di descrizioni.

Esempio di applicazione: ricerca di oggetti in un’immagine tramite query testuale, anche se l’oggetto non era precedentemente noto al modello.