Sobes.tech
Senior

O que é OWL-ViT?

sobes.tech IA

Resposta da IA

OWL-ViT (Open-World Learning Vision Transformer) é um modelo que combina capacidades de processamento de imagens e texto para resolver tarefas de compreensão multimodal. Baseia-se na arquitetura Vision Transformer (ViT) e destina-se a um mundo aberto, ou seja, capaz de reconhecer e relacionar objetos e conceitos que não estavam explicitamente presentes no conjunto de dados de treino.

A ideia principal do OWL-ViT é usar grandes modelos de linguagem e transformadores para ligar características visuais a descrições textuais, permitindo que o modelo realize tarefas como busca por objetos numa imagem através de uma consulta textual, classificação com um conjunto aberto de classes e geração de descrições.

Exemplo de aplicação: busca de objetos numa imagem por consulta textual, mesmo que o objeto não fosse previamente conhecido pelo modelo.