Middle — Senior
Perché 80/10/10 nel mascheramento BERT (maschera, casuale, originale)?
sobes.tech AI
Risposta dell'AI
Nel pre-addestramento di BERT viene utilizzata una strategia di mascheramento dei token per addestrare il modello a prevedere le parole nascoste. La regola 80/10/10 significa che, tra tutti i token selezionati per la mascheratura:
- L'80% viene sostituito con un token speciale [MASK], affinché il modello impari a prevedere esattamente le parole mascherate.
- Il 10% viene sostituito con token casuali, affinché il modello non si sovraccarichi sul modello di mascheramento e impari a essere resistente al rumore.
- Il 10% viene lasciato invariato (token originali), affinché il modello mantenga il contesto e non dipenda troppo dalla presenza di [MASK].
Questo equilibrio aiuta il modello a generalizzare meglio ed evitare il sovrallenamento su maschere artificiali.