Middle — Senior
Pourquoi 80/10/10 dans le masquage BERT (masque, aléatoire, original) ?
sobes.tech IA
Réponse de l'IA
Dans le pré-entraînement de BERT, une stratégie de masquage des tokens est utilisée pour entraîner le modèle à prédire les mots cachés. La règle 80/10/10 signifie que, parmi tous les tokens sélectionnés pour le masquage :
- 80 % sont remplacés par un token spécial [MASK], afin que le modèle apprenne à prédire précisément les mots masqués.
- 10 % sont remplacés par des tokens aléatoires, pour que le modèle ne surentraîne pas sur le motif de masquage et apprenne à être résilient au bruit.
- 10 % sont laissés inchangés (tokens originaux), pour que le modèle conserve le contexte et ne dépende pas trop de la présence de [MASK].
Cet équilibre aide le modèle à mieux généraliser et à éviter le surentraînement sur des masques artificiels.