Was ist Daten-Drift?
sobes.tech KI
Antwort von AI
Datenverschiebung ist eine Veränderung in der Verteilung oder den Eigenschaften der Eingabedaten im Laufe der Zeit, was die Qualität der Leistung des maschinellen Lernmodells negativ beeinflussen kann.
Zum Beispiel, wenn ein Modell mit Daten mit bestimmten Eigenschaften trainiert wurde und sich in der realen Anwendung die Daten zu ändern beginnen (z.B. das Verhalten der Nutzer, Umweltbedingungen, Datenformat), kann das Modell schlechter werden.
Arten der Datenverschiebung:
- Konzeptverschiebung (concept drift): Die Abhängigkeit zwischen Eingabedaten und Zielvariable ändert sich.
- Verteilungsverschiebung der Daten (data distribution drift): Die Verteilung der Eingabedaten ändert sich, ohne die Abhängigkeit zur Zielvariable zu verändern.
Um der Datenverschiebung entgegenzuwirken, werden Modellqualitätsüberwachung, Protokollierung der Eingabedaten und Ergebnisse sowie regelmäßiges Nachtrainieren des Modells mit neuen Daten eingesetzt.
Beispiel: Ein Kredit-Scoring-Modell, das mit Daten von Kunden aus dem Jahr 2019 trainiert wurde, aber im Jahr 2023 hat sich die wirtschaftliche Lage geändert, und das Verhalten der Kunden ist anders geworden — dies ist eine Datenverschiebung, die eine Modellanpassung erfordert.