Middle
Wie teilt man die Daten für die Validierung in Schichten auf?
sobes.tech KI
Antwort von AI
Datenstratifizierung bei der Validierung ist notwendig, um die Verhältnisse der Klassen oder anderer wichtiger Merkmale in den Trainings- und Testdatensätzen beizubehalten. Dies ist besonders bei unausgewogenen Daten wichtig.
So teilt man Daten in Schichten:
- Identifizieren Sie das Schlüsselkriterium für die Stratifikation (z.B. die Zielklasse).
- Verwenden Sie stratified Methoden wie StratifiedKFold oder train_test_split mit dem Parameter stratify in scikit-learn.
Beispiel mit scikit-learn:
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, stratify=y, random_state=42
)
Damit stellen Sie sicher, dass die Klassenverteilung in Trainings- und Testdaten gleich bleibt, was die Modellbewertung verbessert.