Sobes.tech
Middle — Senior

რატომ 80/10/10 BERT-ის მასკირების დროს (მასკა, შემთხვევით, ორიგინალი)?

sobes.tech AI

პასუხი AI-სგან

BERT-ის წინასწარი სწავლების დროს გამოიყენება ტოკენების მასკირება სტრატეგია, რათა მოდელი ისწავლოს დამალული სიტყვების წინასწარ პროგნოზირება. 80/10/10 წესი ნიშნავს, რომ ყველა მასკირებისათვის შერჩეულ ტოკენებს შორის:

  • 80% იცვლება სპეციალურ [MASK] ტოკენზე, რათა მოდელმა ისწავლოს ზუსტად მასკირებული სიტყვების წინასწარ პროგნოზირება.
  • 10% იცვლება შემთხვევით ტოკენებზე, რათა მოდელი არ გადამზადდეს მასკირების ნიმუშზე და ისწავლოს ხმაურის წინააღმდეგ გამძლეობა.
  • 10% რჩება უცვლელი (ორიგინალური ტოკენები), რათა მოდელმა შეინარჩუნოს კონტექსტი და არ იყოს ძალიან დამოკიდებული [MASK]-ის არსებობაზე.

ეს ბალანსი ეხმარება მოდელს უკეთ გააფართოვოს და თავიდან აიცილოს ხელოვნურად შექმნილი მასკების ზედმეტი სწავლება.