Jak przebiega proces budowy drzewa decyzyjnego? Jakie kryteria podziału znasz?
sobes.tech AI
Odpowiedź od AI
Drzewo decyzyjne jest budowane poprzez sekwencyjne dzielenie początkowego zbioru danych na podzbiory, które stają się węzłami drzewa. Na każdym kroku wybierana jest cecha i próg (dla cech numerycznych), które dzielą dane na części tak, aby zmaksymalizować jednorodność (czystość) otrzymanych podzbiorów względem zmiennej celu.
Główne kryteria podziału:
-
Wskaźnik Gini (Gini impurity) — mierzy prawdopodobieństwo błędnej klasyfikacji losowo wybranego obiektu, jeśli zostanie on losowo sklasyfikowany według rozkładu klas w podzbiorze. Im mniejszy, tym lepiej.
-
Zysk informacji (Information Gain) — różnica entropii przed i po podziale. Im większy zysk informacji, tym lepszy podział.
-
Współczynnik zysku informacji (Information Gain Ratio) — modyfikacja zysku informacji, uwzględniająca liczbę i rozmiar podzbiorów, aby uniknąć uprzedzeń wobec cech z dużą liczbą wartości.
-
Redukcja wariancji (Variance reduction) — używany w regresji, minimalizuje rozrzut wartości zmiennej celu w podzbiorach.
Przykład prostego podziału według cechy:
# Pseudokod do wyboru najlepszego podziału
best_gain = 0
best_feature = None
for feature in features:
for threshold in possible_thresholds(feature):
left, right = split(data, feature, threshold)
gain = information_gain(data, left, right)
if gain > best_gain:
best_gain = gain
best_feature = (feature, threshold)