Sobes.tech
Senior

Какво е OWL-ViT?

sobes.tech AI

Отговор от AI

OWL-ViT (Open-World Learning Vision Transformer) е модел, който комбинира възможностите за обработка на изображения и текст за решаване на задачи за мултимодално разбиране. Той е базиран на архитектурата Vision Transformer (ViT) и е предназначен за открит свят, тоест способен да разпознава и свързва обекти и концепции, които не са били явно представени в обучаващия набор от данни.

Основната идея на OWL-ViT е използването на големи езикови модели и трансформатори за свързване на визуалните признаци с текстови описания, което позволява на модела да изпълнява задачи като търсене на обекти в изображение по текстов запрос, класификация с отворен набор от класове и генериране на описания.

Пример за приложение: търсене на обекти в изображение по текстов запрос, дори ако обектът не е бил предварително известен на модела.