Sobes.tech
Middle

OCR için hangi metrikler kullanılır?

sobes.tech yapay zeka

AI'dan gelen yanıt

OCR (Optik Karakter Tanıma) kalitesini değerlendirmek için genellikle aşağıdaki metrikler kullanılır:

  • Karakter Hata Oranı (CER) — karakter seviyesinde hata yüzdesi. Referans metindeki toplam karakter sayısına eklenen, çıkarılan ve değiştirilen karakterlerin sayısının oranı olarak hesaplanır.

  • Kelime Hata Oranı (WER) — CER'e benzer, ancak kelime seviyesinde. Tüm kelimelerin doğru tanınıp tanınmadığını değerlendirmek için önemlidir.

  • Doğruluk (Accuracy) — doğru tanınan karakter veya kelime oranı.

  • Precision, Recall ve F1-score — OCR belirli varlıkları veya karakter sınıflarını çıkarmak için kullanılıyorsa uygulanabilir.

CER hesaplama örneği:

import editdistance

def cer(reference, hypothesis):
    ref = list(reference)
    hyp = list(hypothesis)
    distance = editdistance.eval(ref, hyp)
    return distance / len(ref)

reference = "örnek"
hypothesis = "örnek"
print(f"CER: {cer(reference, hypothesis):.2%}")

Bu metrikler, farklı OCR sistemlerini nesnel olarak karşılaştırmaya ve kalitelerini artırmaya yardımcı olur.