Middle — Senior
Γιατί 80/10/10 στην κάλυψη BERT (μάσκα, τυχαία, αυθεντική);
sobes.tech AI
Απάντηση από AI
Στην προεκπαίδευση του BERT, χρησιμοποιείται μια στρατηγική μάσκας των tokens για την εκπαίδευση του μοντέλου να προβλέπει κρυμμένες λέξεις. Ο κανόνας 80/10/10 σημαίνει ότι, από όλα τα tokens που επιλέγονται για μάσκα:
- Το 80% αντικαθίσταται με ένα ειδικό token [MASK], ώστε το μοντέλο να μάθει να προβλέπει ακριβώς τις μάσκες λέξεις.
- Το 10% αντικαθίσταται με τυχαία tokens, ώστε το μοντέλο να μην υπερεκπαιδεύεται στο μοτίβο μάσκας και να μαθαίνει να είναι ανθεκτικό στον θόρυβο.
- Το 10% παραμένει αμετάβλητο (αρχικά tokens), ώστε το μοντέλο να διατηρεί το πλαίσιο και να μην εξαρτάται υπερβολικά από την παρουσία του [MASK].
Αυτή η ισορροπία βοηθά το μοντέλο να γενικεύει καλύτερα και να αποφεύγει την υπερεκπαίδευση σε τεχνητά δημιουργημένες μάσκες.