Sobes.tech
Senior

OWL-ViT nədir?

sobes.tech Süni İntellekt

AI-dan cavab

OWL-ViT (Open-World Learning Vision Transformer) — bu çoxmodlu anlayış tapşırıqlarını həll etmək üçün şəkil və mətn imkanlarını birləşdirən modeldir. O, Vision Transformer (ViT) arxitekturasına əsaslanır və açıq dünya üçün nəzərdə tutulmuşdur, yəni təlim dəstində açıq şəkildə təqdim edilməyən obyektləri və anlayışları tanıya və əlaqələndirə bilir.

OWL-ViT-in əsas ideyası böyük dil modelləri və transformatorlardan istifadə edərək vizual xüsusiyyətləri mətn təsvirləri ilə əlaqələndirməkdir, bu da modelə şəkil üzərində obyekt axtarışını, açıq sinif dəstləri ilə təsnifat və təsvirlərin yaradılmasını həyata keçirməyə imkan verir.

Tətbiq nümunəsi: mətn sorğusu ilə şəkil üzərində obyekt axtarışı, hətta obyekt model tərəfindən əvvəlcədən məlum olmasa belə.