Senior
Kas yra benchmarkų užterštumas ir kaip su juo kovoti?
sobes.tech AI
Atsakymas iš AI
Benchmarkų užterštumas yra situacija, kai naudojami duomenys, skirti modelio mokymui, sutampa arba susikerta su duomenimis, kuriais atliekama vertinimas (testavimas). Tai sukelia pervertintus rezultatus, nes modelis jau "pažįsta" testinius pavyzdžius.
Kaip su tuo kovoti:
- Aiškus duomenų atskyrimas: griežtas mokymo, validacijos ir testavimo rinkinių atskyrimas be susikirtimų.
- Susikirtimų patikrinimas: automatinis dubliavimų ar labai panašių pavyzdžių paieška ir pašalinimas iš mokymo ir testo rinkinių.
- Naudojant naujus, nepriklausomus duomenų rinkinius: vertinant modelį, naudojami duomenys, kurie nebuvo naudoti ir negalėjo būti naudoti mokymo metu.
- Duomenų šaltinių kontrolė: duomenų kilmės stebėjimas, siekiant išvengti atsitiktinio testinių pavyzdžių įtraukimo į mokymo rinkinį.
Didelių kalbos modelių (LLM) kontekste užterštumas yra ypač kritiškas, nes modeliai mokomi didžiuliuose korpusuose, o testiniai duomenų rinkiniai gali atsitiktinai patekti į mokymo rinkinį, iškraipydami vertinimo rezultatus.