Middle
Co jsou bias a variance, a co se snižuje v náhodném lese?
sobes.tech AI
Odpověď od AI
Ve strojovém učení:
- Bias (zkreslení) — je chyba, která vzniká kvůli příliš jednoduchému modelu, který nedokáže dobře aproximovat skutečnou závislost. Vysoké zkreslení vede k podtrénování.
- Variační (rozptyl) — je citlivost modelu na změny v trénovacích datech. Vysoký rozptyl znamená, že model je příliš přizpůsoben šumu v datech, což vede k přetrénování.
Náhodný les je soubor rozhodovacích stromů postavených na náhodných podmnožinách dat a rysů. Snižuje rozptyl ve srovnání s jednotlivým stromem, protože průměrování předpovědí snižuje vliv náhodných výkyvů v datech, zatímco bias zůstává přibližně na úrovni jednotlivých stromů nebo mírně roste.
Příklad:
from sklearn.ensemble import RandomForestClassifier
# Náhodný les snižuje rozptyl průměrováním
model = RandomForestClassifier(n_estimators=100)
model.fit(X_train, y_train)