¿Cómo es el proceso de construcción del árbol de decisiones? ¿Qué criterios de división conoces?
sobes.tech AI
Respuesta de la IA
El árbol de decisiones se construye mediante una división secuencial del conjunto de datos original en subconjuntos, que se convierten en nodos del árbol. En cada paso, se selecciona una característica y un umbral (para características numéricas), con los cuales los datos se dividen en partes para maximizar la homogeneidad (pureza) de los subconjuntos resultantes en relación con la variable objetivo.
Criterios principales de división:
-
Índice de Gini (Gini impurity) — mide la probabilidad de error en la clasificación de un objeto seleccionado aleatoriamente, si se clasifica aleatoriamente según la distribución de clases en el subconjunto. Cuanto menor, mejor.
-
Entropía informativa (Information Gain) — diferencia en la entropía antes y después de la división. Cuanto mayor sea la ganancia de información, mejor será la división.
-
Criterio de ganancia de información (Information Gain Ratio) — modificación de la ganancia de información que considera la cantidad y tamaño de los subconjuntos para evitar sesgos hacia características con muchos valores.
-
Criterio de reducción de varianza (Variance reduction) — se usa para regresión, minimiza la dispersión de los valores de la variable objetivo en los subconjuntos.
Ejemplo de división simple por característica:
# Pseudocódigo para seleccionar la mejor división
best_gain = 0
best_feature = None
for feature in features:
for threshold in possible_thresholds(feature):
left, right = split(data, feature, threshold)
gain = information_gain(data, left, right)
if gain > best_gain:
best_gain = gain
best_feature = (feature, threshold)