Middle
Comment diviser les données en strates pour la validation?
sobes.tech IA
Réponse de l'IA
La stratification des données lors de la validation est nécessaire pour préserver les proportions des classes ou d'autres caractéristiques importantes dans les ensembles d'entraînement et de test. Cela est particulièrement important en cas de données déséquilibrées.
Comment diviser les données en strates :
- Identifier la caractéristique clé pour la stratification (par exemple, la classe cible).
- Utiliser des méthodes de partition stratifiée, comme StratifiedKFold ou train_test_split avec le paramètre stratify dans scikit-learn.
Exemple avec scikit-learn :
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, stratify=y, random_state=42
)
Ainsi, vous garantissez que la distribution des classes dans les ensembles d'entraînement et de test sera identique, ce qui améliorera la qualité de l'évaluation du modèle.