Sobes.tech
Middle

Ինչպե՞ս բաժանել տվյալները շերտերի համար վավերացման համար։

sobes.tech AI

Պատասխան AI-ից

Տվյալների շերտավորումը վավերացման ժամանակ անհրաժեշտ է՝ պահելու դասերի կամ այլ կարևոր հատկանիշների հարաբերակցությունը ուսուցման և փորձարկման հավաքածուներում: Սա հատկապես կարևոր է անհավասարակշիռ տվյալների դեպքում:

Ինչպես բաժանել տվյալները շերտերով՝

  1. Հստակեցրեք հիմնական հատկանիշը շերտավորելու համար (օրինակ՝ նպատակային դասը):
  2. Օգտագործեք շերտավոր բաժանման մեթոդներ, ինչպիսիք են StratifiedKFold կամ train_test_split՝ շերտավորական պարամետրով scikit-learn-ում:
from sklearn.model_selection import train_test_split

X_train, X_test, y_train, y_test = train_test_split(
    X, y, test_size=0.2, stratify=y, random_state=42
)

Այսպիսով, դուք ապահովում եք, որ դասերի բաշխումը ուսուցման և փորձարկման հավաքածուներում կլինի նույնը, ինչը կբարելավի մոդելի գնահատման որակը։