Wat is datadrift?
sobes.tech AI
Antwoord van AI
Drijf van gegevens is een verandering in de verdeling of kenmerken van de invoergegevens in de loop van de tijd, wat de kwaliteit van de prestaties van het machine learning-model negatief kan beïnvloeden.
Bijvoorbeeld, als een model is getraind op gegevens met bepaalde eigenschappen, en in de praktijk beginnen de gegevens te veranderen (bijvoorbeeld het gedrag van gebruikers, omgevingsomstandigheden, datavormaat), kan het model slechter gaan presteren.
Types gegevensdrift:
- Concept drift: de afhankelijkheid tussen invoergegevens en de doelvariabele verandert.
- Data distributie drift: de verdeling van de invoergegevens verandert zonder de afhankelijkheid van de doelvariabele te wijzigen.
Om gegevensdrift tegen te gaan, wordt modelkwaliteitsmonitoring, logging van invoergegevens en resultaten, en regelmatige hertraining van het model met nieuwe gegevens toegepast.
Voorbeeld: een kredietscoremodel getraind op gegevens van klanten uit 2019, maar in 2023 is de economische situatie veranderd en is het gedrag van klanten anders geworden — dit is gegevensdrift die aanpassing van het model vereist.