Sobes.tech
Middle — Senior

Warum 80/10/10 beim Maskieren von BERT (Maskierung, zufällig, original)?

sobes.tech KI

Antwort von AI

Beim Vortraining von BERT wird eine Maskierungsstrategie für Tokens verwendet, um das Modell zu trainieren, versteckte Wörter vorherzusagen. Die Regel 80/10/10 bedeutet, dass von allen ausgewählten Tokens zum Maskieren:

  • 80% durch ein spezielles Token [MASK] ersetzt werden, damit das Modell lernt, genau die maskierten Wörter vorherzusagen.
  • 10% durch zufällige Tokens ersetzt werden, damit das Modell nicht auf das Maskierungsmuster übertrainiert wird und lernt, widerstandsfähig gegen Rauschen zu sein.
  • 10% bleiben unverändert (Originaltokens), damit das Modell den Kontext beibehält und nicht zu sehr auf das Vorhandensein von [MASK] angewiesen ist.

Dieses Gleichgewicht hilft dem Modell, besser zu generalisieren und Überanpassung an künstlich erstellte Masken zu vermeiden.