Czym jest dryf danych?
sobes.tech AI
Odpowiedź od AI
Dryf danych to zmiana w rozkładzie lub cechach danych wejściowych w czasie, co może negatywnie wpływać na jakość działania modelu uczenia maszynowego.
Na przykład, jeśli model został wytrenowany na danych o określonych właściwościach, a w rzeczywistej eksploatacji dane zaczynają się zmieniać (np. zachowanie użytkowników, warunki środowiskowe, format danych), model może zacząć działać gorzej.
Typy dryfu danych:
- Dryf koncepcji (concept drift): zmienia się zależność między danymi wejściowymi a zmienną docelową.
- Dryf rozkładu danych (data distribution drift): zmienia się rozkład danych wejściowych bez zmiany zależności od zmiennej docelowej.
Aby przeciwdziałać dryfowi danych, stosuje się monitorowanie jakości modelu, logowanie danych wejściowych i wyników oraz regularne ponowne szkolenie modelu na nowych danych.
Przykład: model scoringu kredytowego wytrenowany na danych klientów z 2019 roku, ale w 2023 roku sytuacja gospodarcza się zmieniła, a zachowanie klientów stało się inne — to dryf danych, który wymaga adaptacji modelu.