Jak probíhá proces stavby rozhodovacího stromu? Jaké kritéria rozdělení znáte?
sobes.tech AI
Odpověď od AI
Rozhodovací strom je sestavován sekvenčním rozdělením původního datového souboru na podmnožiny, které se stávají uzly stromu. V každém kroku je vybrána vlastnost a práh (pro číselné vlastnosti), podle kterých jsou data rozdělena na části tak, aby maximalizovala homogennost (čistotu) získaných podmnožin vzhledem k cílové proměnné.
Hlavní kritéria rozdělení:
-
Index Gini (Gini impurity) — měří pravděpodobnost chybné klasifikace náhodně vybraného objektu, pokud je klasifikován náhodně podle rozložení tříd v podmnožině. Čím je nižší, tím lépe.
-
Informační zisk (Information Gain) — rozdíl entropie před a po rozdělení. Čím větší je zisk informace, tím lepší je rozdělení.
-
Poměr zisku informace (Information Gain Ratio) — modifikace informačního zisku, která zohledňuje počet a velikost podmnožin, aby se předešlo zkreslení ve prospěch vlastností s velkým počtem hodnot.
-
Redukce rozptylu (Variance reduction) — používá se pro regresi, minimalizuje rozptyl hodnot cílové proměnné v podmnožinách.
Příklad jednoduchého rozdělení podle vlastnosti:
# Pseudokód pro výběr nejlepšího rozdělení
best_gain = 0
best_feature = None
for feature in features:
for threshold in possible_thresholds(feature):
left, right = split(data, feature, threshold)
gain = information_gain(data, left, right)
if gain > best_gain:
best_gain = gain
best_feature = (feature, threshold)