Sobes.tech
Middle

Quelles métriques sont utilisées pour l'OCR?

sobes.tech IA

Réponse de l'IA

Pour évaluer la qualité de la reconnaissance optique de caractères (OCR), on utilise généralement les métriques suivantes :

  • Taux d'erreur de caractère (CER) — pourcentage d'erreurs au niveau des caractères. Il est calculé comme le rapport entre le nombre d'insertsions, de suppressions et de substitutions de caractères et le nombre total de caractères dans le texte de référence.

  • Taux d'erreur de mot (WER) — similaire au CER, mais au niveau des mots. Important pour évaluer la reconnaissance correcte de mots entiers.

  • Précision (Exactitude) — proportion de caractères ou de mots correctement reconnus.

  • Précision, rappel et score F1 — applicables si l'OCR est utilisé pour extraire des entités ou des classes spécifiques de caractères.

Exemple de calcul du CER :

import editdistance

def cer(reference, hypothesis):
    ref = list(reference)
    hyp = list(hypothesis)
    distance = editdistance.eval(ref, hyp)
    return distance / len(ref)

reference = "exemple"
hypothesis = "exmple"
print(f"CER : {cer(reference, hypothesis):.2%}")

Ces métriques aident à comparer objectivement différents systèmes OCR et à améliorer leur qualité.