Sobes.tech
Middle — Senior

Γιατί 80/10/10 στην κάλυψη BERT (μάσκα, τυχαία, αυθεντική);

sobes.tech AI

Απάντηση από AI

Στην προεκπαίδευση του BERT, χρησιμοποιείται μια στρατηγική μάσκας των tokens για την εκπαίδευση του μοντέλου να προβλέπει κρυμμένες λέξεις. Ο κανόνας 80/10/10 σημαίνει ότι, από όλα τα tokens που επιλέγονται για μάσκα:

  • Το 80% αντικαθίσταται με ένα ειδικό token [MASK], ώστε το μοντέλο να μάθει να προβλέπει ακριβώς τις μάσκες λέξεις.
  • Το 10% αντικαθίσταται με τυχαία tokens, ώστε το μοντέλο να μην υπερεκπαιδεύεται στο μοτίβο μάσκας και να μαθαίνει να είναι ανθεκτικό στον θόρυβο.
  • Το 10% παραμένει αμετάβλητο (αρχικά tokens), ώστε το μοντέλο να διατηρεί το πλαίσιο και να μην εξαρτάται υπερβολικά από την παρουσία του [MASK].

Αυτή η ισορροπία βοηθά το μοντέλο να γενικεύει καλύτερα και να αποφεύγει την υπερεκπαίδευση σε τεχνητά δημιουργημένες μάσκες.