Sobes.tech
Middle

Hogyan osztjuk fel az adatokat rétegekre az érvényesítéshez?

sobes.tech MI

Válasz az MI-től

Az adatok stratifikálása a validáció során szükséges ahhoz, hogy megőrizze a osztályok vagy más fontos jellemzők arányait a tanuló- és tesztkészletekben. Ez különösen fontos kiegyensúlyozatlan adatok esetén.

Hogyan osszuk fel az adatokat rétegekre:

  1. Határozzuk meg a stratifikáció kulcsfontosságú jellemzőjét (pl. célosztály).
  2. Használjunk stratifikált felosztási módszereket, például StratifiedKFold vagy train_test_split stratify paraméterrel a scikit-learn-ben.

Példa scikit-learn-nel:

from sklearn.model_selection import train_test_split

X_train, X_test, y_train, y_test = train_test_split(
    X, y, test_size=0.2, stratify=y, random_state=42
)

Így biztosítható, hogy az osztályok eloszlása a tanuló- és tesztkészletekben ugyanaz marad, ami javítja a modell értékelésének minőségét.