Hai mai riscontrato una fuga di dati durante l'addestramento del modello?
sobes.tech AI
Risposta dell'AI
Sì, la perdita di dati (data leakage) durante l’addestramento di un modello è un problema comune, quando informazioni non disponibili in condizioni reali di utilizzo del modello vengono inserite nei dati di addestramento. Questo porta a un overfitting e a una stima gonfiata della qualità.
Esempio: nella previsione del rischio di credito, una caratteristica nel set di addestramento può essere direttamente collegata alla decisione di concedere il credito (ad esempio, lo stato di approvazione), che nella vita reale non è noto al momento della previsione.
Per evitare la perdita di dati, è importante:
- Separare chiaramente i dati di addestramento e di test per tempo o altri criteri.
- Escludere caratteristiche che contengono informazioni sulla variabile target o eventi futuri.
- Effettuare un’analisi approfondita delle caratteristiche e della logica di business.
In pratica, ho incontrato perdite di dati lavorando con serie temporali, quando dati futuri accidentalmente finivano nel set di addestramento, portando a metriche irrealisticamente alte.