Sobes.tech
Middle

რა მეტრიკებს იყენებენ OCR-ისთვის?

sobes.tech AI

პასუხი AI-სგან

OCR (ოპტიკური სიმბოლოს აღიარება) ხარისხის შეფასებისთვის ჩვეულებრივ გამოიყენება შემდეგი მეტრიკები:

  • სიმბოლოს შეცდომის მაჩვენებელი (CER) — შეცდომების პროცენტი სიმბოლოს დონეზე. ითვლება როგორც შეცდომების რაოდენობის და ჩასმის, წაშლის და შეცვლის რაოდენობის შეფარდება საერთო სიმბოლოს რაოდენობასთან რეფერენციული ტექსტში.

  • სიტყვის შეცდომის მაჩვენებელი (WER) — მსგავსია CER-ის, მაგრამ სიტყვების დონეზე. მნიშვნელოვანია სრული სიტყვების სწორად აღიარების შეფასებისთვის.

  • სიზუსტე (Accuracy) — სწორად აღიარებული სიმბოლოების ან სიტყვების წილი.

  • პრეციზი, Recall და F1-score — გამოიყენება, თუ OCR გამოიყენება გარკვეული არსებულობების ან კლასების ამოღებისთვის.

CER-ის გამოთვლის მაგალითი:

import editdistance

def cer(reference, hypothesis):
    ref = list(reference)
    hyp = list(hypothesis)
    distance = editdistance.eval(ref, hyp)
    return distance / len(ref)

reference = "მიმართვა"
hypothesis = "მიმართვა"
print(f"CER: {cer(reference, hypothesis):.2%}")

ეს მეტრიკები ეხმარება ობიექტურად შეადარონ სხვადასხვა OCR სისტემები და გაუმჯობესონ მათი ხარისხი.