Sobes.tech
Middle — Senior

Por que 80/10/10 na máscara BERT (máscara, aleatório, original)?

sobes.tech IA

Resposta da IA

No pré-treinamento do BERT, é utilizada uma estratégia de máscara de tokens para treinar o modelo a prever palavras ocultas. A regra 80/10/10 significa que, de todos os tokens selecionados para máscara:

  • 80% são substituídos por um token especial [MASK], para que o modelo aprenda a prever exatamente as palavras mascaradas.
  • 10% são substituídos por tokens aleatórios, para que o modelo não sobretreine no padrão de máscara e aprenda a ser resistente ao ruído.
  • 10% são deixados inalterados (tokens originais), para que o modelo mantenha o contexto e não dependa demais da presença de [MASK].

Esse equilíbrio ajuda o modelo a generalizar melhor e evitar o sobreajuste em máscaras artificialmente criadas.