Šta je OWL-ViT?
sobes.tech АИ
Одговор од АИ
OWL-ViT (Open-World Learning Vision Transformer) је модел који комбинује могућности обраде слика и текста за решавање задатака мултимодалног разумевања. Основан је на архитектури Vision Transformer (ViT) и намењен је за отворени свет, односно способан је да препознаје и повезује објекте и концепте који нису били јасно представљени у тренинг скупу података.
Главна идеја OWL-ViT је коришћење великих језичких модела и трансформатора за повезивање визуелних карактеристика са текстуалним описима, што омогућава моделу да извршава задатке као што су претрага објеката на слици преко текстуалних упита, класификација са отвореним скупом класа и генерисање описа.
Пример примене: претрага објеката на слици преко текстуалног упита, чак и ако објекат није раније био познат моделу.