OCR için hangi metrikler kullanılır?
sobes.tech yapay zeka
AI'dan gelen yanıt
OCR (Optik Karakter Tanıma) kalitesini değerlendirmek için genellikle aşağıdaki metrikler kullanılır:
-
Karakter Hata Oranı (CER) — karakter seviyesinde hata yüzdesi. Referans metindeki toplam karakter sayısına eklenen, çıkarılan ve değiştirilen karakterlerin sayısının oranı olarak hesaplanır.
-
Kelime Hata Oranı (WER) — CER'e benzer, ancak kelime seviyesinde. Tüm kelimelerin doğru tanınıp tanınmadığını değerlendirmek için önemlidir.
-
Doğruluk (Accuracy) — doğru tanınan karakter veya kelime oranı.
-
Precision, Recall ve F1-score — OCR belirli varlıkları veya karakter sınıflarını çıkarmak için kullanılıyorsa uygulanabilir.
CER hesaplama örneği:
import editdistance
def cer(reference, hypothesis):
ref = list(reference)
hyp = list(hypothesis)
distance = editdistance.eval(ref, hyp)
return distance / len(ref)
reference = "örnek"
hypothesis = "örnek"
print(f"CER: {cer(reference, hypothesis):.2%}")
Bu metrikler, farklı OCR sistemlerini nesnel olarak karşılaştırmaya ve kalitelerini artırmaya yardımcı olur.