Junior — Middle
Qu'est-ce que le modèle de langage Unigram dans la tokenisation (comme dans SentencePiece) ?
sobes.tech IA
Réponse de l'IA
Le modèle de langage unigram en tokenisation, par exemple dans SentencePiece, est un modèle statistique qui considère le texte comme une séquence de tokens indépendants (sous-mots), chacun ayant sa propre probabilité.
Idée principale:
- Le modèle suppose que chaque token dans la séquence est choisi indépendamment avec une probabilité déterminée (unigram — modèle homogène).
- SentencePiece entraîne un dictionnaire de tokens, en optimisant l'ensemble des sous-mots pour maximiser la probabilité du corpus d'entraînement.
- Lors de la tokenisation, le texte est divisé en une séquence de tokens du dictionnaire qui maximise la probabilité totale selon le modèle.
Avantages:
- Permet de choisir automatiquement l'ensemble optimal de sous-mots sans avoir besoin de définir manuellement un dictionnaire.
- Fonctionne bien avec différentes langues et mots inconnus.
Exemple : pour le mot "unbelievable", le modèle peut le diviser en tokens "un", "believ", "able" avec des probabilités correspondantes, en choisissant la segmentation la plus probable.