Sobes.tech
Senior

Qu'est-ce que OWL-ViT?

sobes.tech IA

Réponse de l'IA

OWL-ViT (Open-World Learning Vision Transformer) est un modèle combinant des capacités de traitement d’images et de texte pour résoudre des tâches de compréhension multimodale. Il est basé sur l’architecture Vision Transformer (ViT) et conçu pour un monde ouvert, c’est-à-dire capable de reconnaître et de relier des objets et des concepts qui n’étaient pas explicitement présents dans le jeu de données d’entraînement.

L’idée principale d’OWL-ViT est d’utiliser de grands modèles linguistiques et des transformateurs pour relier les caractéristiques visuelles aux descriptions textuelles, ce qui permet au modèle d’effectuer des tâches telles que la recherche d’objets dans une image par requête textuelle, la classification avec un ensemble ouvert de classes et la génération de descriptions.

Exemple d’application : recherche d’objets dans une image par requête textuelle, même si l’objet n’était pas connu à l’avance par le modèle.