Sobes.tech
Senior

რა არის OWL-ViT?

sobes.tech AI

პასუხი AI-სგან

OWL-ViT (Open-World Learning Vision Transformer) მოდელი, რომელიც აერთიანებს ვიზუალური და ტექსტური შესაძლებლობებს მრავალმოდალური გაგების ამოცანების გადასაჭრელად. ის დაფუძნებულია Vision Transformer (ViT) არქიტექტურაზე და განკუთვნილია ღია სამყაროსთვის, ანუ შეუძლია აღიაროს და დაკავშიროს ობიექტები და კონცეფციები, რომლებიც არ იყო მკაფიოდ წარმოდგენილი სასწავლო ნაკრებში.

OWL-ViT-ის მთავარი იდეაა დიდი ენობრივი მოდელებისა და ტრანსფორმატორების გამოყენება ვიზუალური ნიშნების დაკავშირებისთვის ტექსტურ აღწერილობებთან, რაც საშუალებას აძლევს მოდელს შეასრულოს ისეთი ამოცანები, როგორიცაა ობიექტების ძიება სურათზე ტექსტური მოთხოვნებით, კლასიფიკაცია ღია კლასების ნაკრებით და აღწერილობების გენერირება.

გამოყენების მაგალითი: ობიექტების ძიება სურათზე ტექსტური მოთხოვნით, მაშინაც კი, თუ ობიექტი წინასწარ არ იყო ცნობილი მოდელის მიერ.