Middle — Senior
რატომ 80/10/10 BERT-ის მასკირების დროს (მასკა, შემთხვევით, ორიგინალი)?
sobes.tech AI
პასუხი AI-სგან
BERT-ის წინასწარი სწავლების დროს გამოიყენება ტოკენების მასკირება სტრატეგია, რათა მოდელი ისწავლოს დამალული სიტყვების წინასწარ პროგნოზირება. 80/10/10 წესი ნიშნავს, რომ ყველა მასკირებისათვის შერჩეულ ტოკენებს შორის:
- 80% იცვლება სპეციალურ [MASK] ტოკენზე, რათა მოდელმა ისწავლოს ზუსტად მასკირებული სიტყვების წინასწარ პროგნოზირება.
- 10% იცვლება შემთხვევით ტოკენებზე, რათა მოდელი არ გადამზადდეს მასკირების ნიმუშზე და ისწავლოს ხმაურის წინააღმდეგ გამძლეობა.
- 10% რჩება უცვლელი (ორიგინალური ტოკენები), რათა მოდელმა შეინარჩუნოს კონტექსტი და არ იყოს ძალიან დამოკიდებული [MASK]-ის არსებობაზე.
ეს ბალანსი ეხმარება მოდელს უკეთ გააფართოვოს და თავიდან აიცილოს ხელოვნურად შექმნილი მასკების ზედმეტი სწავლება.