Sobes.tech
Senior

Was ist die Kontamination von Benchmarks und wie wird dagegen vorgegangen?

sobes.tech KI

Antwort von AI

Benchmark-Kontamination ist eine Situation, in der die Daten, die zum Trainieren des Modells verwendet werden, mit den Daten überschneiden oder übereinstimmen, auf denen die Bewertung (Test) durchgeführt wird. Dies führt zu überhöhten Ergebnissen, da das Modell bereits "vertraut" mit den Testbeispielen ist.

So wird dagegen vorgegangen:

  • Klare Trennung der Daten: strikte Trennung in Trainings-, Validierungs- und Testdatensätze ohne Überschneidungen.
  • Überprüfung auf Überschneidungen: automatische Suche und Entfernung von Duplikaten oder sehr ähnlichen Beispielen zwischen Training und Test.
  • Verwendung neuer, unabhängiger Datensätze: zur Bewertung des Modells werden Daten verwendet, die im Training nicht verwendet wurden und auch nicht verwendet werden konnten.
  • Kontrolle der Datenquellen: Nachverfolgung der Herkunft der Daten, um zu vermeiden, dass Testbeispiele versehentlich in den Trainingsdatensatz gelangen.

Im Kontext großer Sprachmodelle (LLM) ist Kontamination besonders kritisch, da die Modelle auf riesigen Korpora trainiert werden und Testdatensätze versehentlich im Trainingssatz landen können, was die Bewertungsergebnisse verfälscht.