Middle — Senior
¿Por qué 80/10/10 en el enmascaramiento de BERT (máscara, aleatorio, original)?
sobes.tech AI
Respuesta de la IA
En el preentrenamiento de BERT se utiliza una estrategia de enmascaramiento de tokens para entrenar al modelo a predecir palabras ocultas. La regla 80/10/10 significa que, de todos los tokens seleccionados para enmascarar:
- El 80% se reemplazan por un token especial [MASK], para que el modelo aprenda a predecir exactamente las palabras enmascaradas.
- El 10% se reemplazan por tokens aleatorios, para que el modelo no se sobreentrene en el patrón de enmascaramiento y aprenda a ser resistente al ruido.
- El 10% restante se deja sin cambios (tokens originales), para que el modelo conserve el contexto y no dependa demasiado de la presencia de [MASK].
Este equilibrio ayuda al modelo a generalizar mejor y a evitar el sobreentrenamiento en máscaras artificiales.