Mi az a pseudo-labeling táblázatos feladatoknál?
sobes.tech MI
Válasz az MI-től
A pseudo-címkézés egy félig felügyelt tanulási módszer, amelyet gyakran alkalmaznak táblázatos adatok feladataiban. Az ötlet az, hogy egy, címkézett adatokon tanított modellt használjunk nem címkézett adatok címkéinek előrejelzésére, majd ezeket az előrejelzett (pseudo-címkéket) hozzáadjuk a tanulási készlethez további tanulás céljából.
Boostinggal végzett táblázatos feladatoknál ez segít növelni a tanulási adatok mennyiségét, különösen akkor, ha kevés címkézett adat áll rendelkezésre. Például, az első szakaszban a modell a címkézett adatokon tanul, majd előrejelzi a címkéket a nem címkézett rekordokra. Ezután ezek a rekordok pseudo-címkékkel bővítik a tanulási készletet, és a modellt tovább tanítják a kibővített adathalmazon.
Fontos ellenőrizni a pseudo-címkék minőségét, például csak azokat a predikciókat kiválasztva, amelyekben a modell biztos (valószínűség szerint), hogy ne rontsa a tanulás minőségét.
Példa pseudokódban:
# Tanítás címkézett adatokon
model.fit(X_labeled, y_labeled)
# Predikció nem címkézett adatokon
pseudo_labels = model.predict(X_unlabeled)
# Bizalommal bíró predikciók kiválasztása
confident_indices = [i for i, p in enumerate(model.predict_proba(X_unlabeled)) if max(p) > threshold]
# Pseudo-címkék hozzáadása a tanulási készlethez
X_extended = np.concatenate([X_labeled, X_unlabeled[confident_indices]])
y_extended = np.concatenate([y_labeled, pseudo_labels[confident_indices]])
# A modell további tanítása
model.fit(X_extended, y_extended)