Sobes.tech
Junior — Middle

Hoe verloopt het proces van het bouwen van een beslissingsboom? Welke splitsingscriteria kent u?

sobes.tech AI

Antwoord van AI

Beslissingsbomen worden opgebouwd door het sequentieel splitsen van de oorspronkelijke dataset in subsets, die knooppunten van de boom worden. Bij elke stap wordt een kenmerk en een drempel (voor numerieke kenmerken) gekozen, waardoor de gegevens worden verdeeld in delen om de homogeniteit (zuiverheid) van de resulterende subsets ten opzichte van de doelvariabele te maximaliseren.

Belangrijkste criteria voor splitsing:

  • Gini-index (Gini impurity) — meet de kans op foutieve classificatie van een willekeurig geselecteerd object, als het willekeurig wordt geclassificeerd volgens de klasseverdeling in de subset. Hoe lager, hoe beter.

  • Informatiewinst (Information Gain) — het verschil in entropie vóór en na de splitsing. Hoe groter de informatiewinst, hoe beter de splitsing.

  • Informatiewinst-verhouding (Information Gain Ratio) — een modificatie van de informatiewinst die rekening houdt met het aantal en de grootte van de subsets om bias te voorkomen richting kenmerken met veel waarden.

  • Variantie-reductie (Variance reduction) — wordt gebruikt voor regressie, minimaliseert de spreiding van de waarden van de doelvariabele in de subsets.

Voorbeeld van een eenvoudige splitsing op basis van een kenmerk:

# Pseudocode voor het kiezen van de beste splitsing
best_gain = 0
best_feature = None
for feature in features:
    for threshold in possible_thresholds(feature):
        left, right = split(data, feature, threshold)
        gain = information_gain(data, left, right)
        if gain > best_gain:
            best_gain = gain
            best_feature = (feature, threshold)