Sobes.tech
Senior

Šta je OWL-ViT?

sobes.tech АИ

Одговор од АИ

OWL-ViT (Open-World Learning Vision Transformer) је модел који комбинује могућности обраде слика и текста за решавање задатака мултимодалног разумевања. Основан је на архитектури Vision Transformer (ViT) и намењен је за отворени свет, односно способан је да препознаје и повезује објекте и концепте који нису били јасно представљени у тренинг скупу података.

Главна идеја OWL-ViT је коришћење великих језичких модела и трансформатора за повезивање визуелних карактеристика са текстуалним описима, што омогућава моделу да извршава задатке као што су претрага објеката на слици преко текстуалних упита, класификација са отвореним скупом класа и генерисање описа.

Пример примене: претрага објеката на слици преко текстуалног упита, чак и ако објекат није раније био познат моделу.