Sobes.tech
Middle

Milyen mérőszámokat használnak az OCR-hez?

sobes.tech MI

Válasz az MI-től

Az OCR (Optikai karakterfelismerés) minőségének értékeléséhez általában a következő metrikákat használják:

  • Karakter Hibaarány (CER) — karakter szinten elkövetett hibák százaléka. Számítása a beszúrások, törlések és cserék számának aránya a referencia szöveg összes karakteréhez képest.

  • Szó Hibaarány (WER) — hasonló a CER-hez, de szó szinten. Fontos annak értékelésében, hogy mennyire helyesen ismerik fel az egész szavakat.

  • Pontosság (Accuracy) — helyesen felismertek aránya karakterek vagy szavak szintjén.

  • Precízió, Recall és F1-score — alkalmazható, ha az OCR-t bizonyos entitások vagy karakterosztályok kinyerésére használják.

CER számítási példa:

import editdistance

def cer(reference, hypothesis):
    ref = list(reference)
    hyp = list(hypothesis)
    distance = editdistance.eval(ref, hyp)
    return distance / len(ref)

reference = "példa"
hypothesis = "pelda"
print(f"CER: {cer(reference, hypothesis):.2%}")

Ezek a metrikák segítenek objektíven összehasonlítani különböző OCR rendszereket és javítani azok minőségét.