Sobes.tech
Middle — Senior

Kas ir pseudo-labeling tabulārajās uzdevumos?

sobes.tech AI

Atbilde no AI

Pseudo-labeling ir puspaties apmācības metode, kas bieži tiek izmantota tabulas datu uzdevumos. Ideja ir izmantot modeli, kas apmācīts uz marķētiem datiem, lai prognozētu marķierus uz nemarķētiem datiem, un pēc tam šos prognozētos (pseudo-mārķierus) pievienot apmācības kopumam turpmākai apmācībai.

Boosting ar tabulas uzdevumiem tas palīdz palielināt apmācības datu apjomu, īpaši, ja marķēto datu ir maz. Piemēram, pēc pirmās apmācības posma modelis prognozē marķierus nemarķētiem ierakstiem. Tad šie ieraksti ar pseudo-mārķieriem tiek pievienoti apmācības kopumam, un modelis tiek turpināts apmācīt uz paplašinātā kopuma.

Ir svarīgi kontrolēt pseudo-mārķieru kvalitāti, piemēram, izvēloties tikai tās prognozes, kurās modelis ir pārliecināts (pēc varbūtības), lai nepasliktinātu apmācības kvalitāti.

Pseudokods piemērs:

# Apmācība uz marķētiem datiem
model.fit(X_labeled, y_labeled)

# Prognozēšana uz nemarķētiem datiem
pseudo_labels = model.predict(X_unlabeled)

# Uzticamu prognožu izvēle
confident_indices = [i for i, p in enumerate(model.predict_proba(X_unlabeled)) if max(p) > threshold]

# Pseudo-mārķieru pievienošana apmācības kopumam
X_extended = np.concatenate([X_labeled, X_unlabeled[confident_indices]])
y_extended = np.concatenate([y_labeled, pseudo_labels[confident_indices]])

# Papildu modeļa apmācība
model.fit(X_extended, y_extended)