Sobes.tech
Senior

Šta je kontaminacija benchmarkova i kako se s njom bori?

sobes.tech АИ

Одговор од АИ

Zagađenje benchmarkova je situacija kada se podaci koji se koriste za obuku modela preklapaju ili poklapaju sa podacima na kojima se vrši procena (testiranje). To dovodi do precenjenih rezultata, jer je model već "upoznat" sa test primerima.

Kako se sa tim bori:

  • Jasno razdvajanje podataka: strogo razdvajanje na skupove za obuku, validaciju i test bez preklapanja.
  • Provera preklapanja: automatsko traženje i uklanjanje duplikata ili veoma sličnih primera između obuke i testa.
  • Korišćenje novih, nezavisnih skupova podataka: za procenu modela koriste se podaci koji nisu korišćeni i nisu mogli biti korišćeni tokom obuke.
  • Kontrola izvora podataka: praćenje porekla podataka kako bi se izbeglo slučajno uključivanje test primera u skup za obuku.

U kontekstu velikih jezičkih modela (LLM), zagađenje je posebno kritično, jer se modeli obučavaju na ogromnim korpusima, a skupovi podataka za testiranje mogu slučajno završiti u skupu za obuku, što iskrivljuje rezultate procene.