Milyen mérőszámokat használnak az OCR-hez?
sobes.tech MI
Válasz az MI-től
Az OCR (Optikai karakterfelismerés) minőségének értékeléséhez általában a következő metrikákat használják:
-
Karakter Hibaarány (CER) — karakter szinten elkövetett hibák százaléka. Számítása a beszúrások, törlések és cserék számának aránya a referencia szöveg összes karakteréhez képest.
-
Szó Hibaarány (WER) — hasonló a CER-hez, de szó szinten. Fontos annak értékelésében, hogy mennyire helyesen ismerik fel az egész szavakat.
-
Pontosság (Accuracy) — helyesen felismertek aránya karakterek vagy szavak szintjén.
-
Precízió, Recall és F1-score — alkalmazható, ha az OCR-t bizonyos entitások vagy karakterosztályok kinyerésére használják.
CER számítási példa:
import editdistance
def cer(reference, hypothesis):
ref = list(reference)
hyp = list(hypothesis)
distance = editdistance.eval(ref, hyp)
return distance / len(ref)
reference = "példa"
hypothesis = "pelda"
print(f"CER: {cer(reference, hypothesis):.2%}")
Ezek a metrikák segítenek objektíven összehasonlítani különböző OCR rendszereket és javítani azok minőségét.