რა მეტრიკებს იყენებენ OCR-ისთვის?
sobes.tech AI
პასუხი AI-სგან
OCR (ოპტიკური სიმბოლოს აღიარება) ხარისხის შეფასებისთვის ჩვეულებრივ გამოიყენება შემდეგი მეტრიკები:
-
სიმბოლოს შეცდომის მაჩვენებელი (CER) — შეცდომების პროცენტი სიმბოლოს დონეზე. ითვლება როგორც შეცდომების რაოდენობის და ჩასმის, წაშლის და შეცვლის რაოდენობის შეფარდება საერთო სიმბოლოს რაოდენობასთან რეფერენციული ტექსტში.
-
სიტყვის შეცდომის მაჩვენებელი (WER) — მსგავსია CER-ის, მაგრამ სიტყვების დონეზე. მნიშვნელოვანია სრული სიტყვების სწორად აღიარების შეფასებისთვის.
-
სიზუსტე (Accuracy) — სწორად აღიარებული სიმბოლოების ან სიტყვების წილი.
-
პრეციზი, Recall და F1-score — გამოიყენება, თუ OCR გამოიყენება გარკვეული არსებულობების ან კლასების ამოღებისთვის.
CER-ის გამოთვლის მაგალითი:
import editdistance
def cer(reference, hypothesis):
ref = list(reference)
hyp = list(hypothesis)
distance = editdistance.eval(ref, hyp)
return distance / len(ref)
reference = "მიმართვა"
hypothesis = "მიმართვა"
print(f"CER: {cer(reference, hypothesis):.2%}")
ეს მეტრიკები ეხმარება ობიექტურად შეადარონ სხვადასხვა OCR სისტემები და გაუმჯობესონ მათი ხარისხი.