Wie verläuft der Prozess des Aufbaus eines Entscheidungsbaums? Welche Teilungskriterien kennen Sie?
sobes.tech KI
Antwort von AI
Der Entscheidungsbaum wird durch eine sequenzielle Aufteilung des ursprünglichen Datensatzes in Untergruppen aufgebaut, die zu Knoten des Baumes werden. Bei jedem Schritt wird eine Eigenschaft und ein Schwellenwert (für numerische Eigenschaften) ausgewählt, anhand dessen die Daten in Teile aufgeteilt werden, um die Homogenität (Reinheit) der resultierenden Untergruppen in Bezug auf die Zielvariable zu maximieren.
Hauptkriterien für die Aufteilung:
-
Gini-Index (Gini-Impurity) — misst die Wahrscheinlichkeit eines Fehlers bei der zufälligen Klassifizierung eines Objekts, wenn es zufällig nach der Verteilung der Klassen im Unterset eingeteilt wird. Je niedriger, desto besser.
-
Informationsgewinn (Information Gain) — Differenz der Entropie vor und nach der Aufteilung. Je größer der Informationsgewinn, desto besser die Aufteilung.
-
Informationsgewinn-Verhältnis (Information Gain Ratio) — Modifikation des Informationsgewinns, die die Anzahl und Größe der Untergruppen berücksichtigt, um eine Verzerrung zugunsten von Eigenschaften mit vielen Werten zu vermeiden.
-
Varianzreduktion (Variance reduction) — wird für Regressionen verwendet, minimiert die Streuung der Zielvariablenwerte in den Untergruppen.
Beispiel für eine einfache Aufteilung anhand einer Eigenschaft:
# Pseudocode zur Auswahl der besten Aufteilung
best_gain = 0
best_feature = None
for feature in features:
for threshold in possible_thresholds(feature):
left, right = split(data, feature, threshold)
gain = information_gain(data, left, right)
if gain > best_gain:
best_gain = gain
best_feature = (feature, threshold)