Hansı sətir tanıma modelləri (CRNN, TrOCR)?
sobes.tech Süni İntellekt
AI-dan cavab
CRNN və TrOCR kimi sətir tanıma modelləri, xüsusən də şəkillərdə və ya sənədlərdə mətni tanımaq üçün optik xarakter tanıma (OCR) üçün istifadə olunur.
-
CRNN (Konvolusional Təkrarlanan Neyron Şəbəkəsi), şəkildən xüsusiyyətləri çıxarmaq üçün konvolusional neyron şəbəkələr (CNN) və ardıcıllıqları işləmək üçün təkrarlanan neyron şəbəkələr (RNN) birləşdirən bir memaridir. CRNN, sətirdəki simvolların kontekstini nəzərə aldığı üçün mətnin tanınması üçün uyğundur. Ümumiyyətlə, o, küçə nişanları və ya sənədlər kimi ardıcıl struktura malik şəkillərdə mətnin tanınması üçün istifadə olunur.
-
TrOCR (Transformator əsaslı OCR), transformator arxitekturasına əsaslanan müasir bir modeldir və NLP-də (Təbii Dil İşləmə) istifadə olunan metodlara bənzər üsulları tətbiq edir. TrOCR, şəkli emal etmək üçün encoder və mətni yaratmaq üçün decoder istifadə edir, bu da mürəkkəb və müxtəlif şrift və üslubları effektiv şəkildə tanımağa imkan verir.
Hər iki model, mətni olan şəkli rəqəmsal sətirə çevirmək vəzifəsini həll edir, lakin TrOCR adətən transformatorların gücü sayəsində mürəkkəb sənədlərdə daha yaxşı nəticələr göstərir.
CRNN-in istifadəsinə nümunə, avtomobil nömrə nişanındakı mətni tanımaqdır, TrOCR isə kitabların və ya əl yazmalarının skan edilmiş səhifələrini tanımaq üçün istifadə olunur.