Is het je ooit overkomen dat er een datalek was tijdens het trainen van het model?
sobes.tech AI
Antwoord van AI
Ja, data leakage (gegevenslek) tijdens het trainen van een model is een veelvoorkomend probleem, waarbij informatie die niet beschikbaar is onder echte gebruiksomstandigheden in de trainingsgegevens terechtkomt. Dit leidt tot overfitting en een overschatting van de kwaliteit.
Voorbeeld: bij het voorspellen van kredietrisico kan een kenmerk in de trainingsset direct gerelateerd zijn aan de beslissing om krediet te verstrekken (bijvoorbeeld de goedkeuringsstatus), die in het echte leven niet bekend is op het moment van voorspelling.
Om data leakage te voorkomen, is het belangrijk:
- Duidelijk onderscheid te maken tussen trainings- en testgegevens op basis van tijd of andere criteria.
- Kenmerken uit te sluiten die informatie bevatten over de doelvariabele of toekomstige gebeurtenissen.
- Een grondige analyse uit te voeren van kenmerken en bedrijfslogica.
In de praktijk ben ik geconfronteerd met leakage bij het werken met tijdreeksen, wanneer gegevens uit de toekomst per ongeluk in de trainingsset terechtkwamen, wat leidde tot onrealistisch hoge metrics.