Karar ağacı oluşturma süreci nasıl gerçekleşir? Hangi bölme kriterlerini biliyorsunuz?
sobes.tech yapay zeka
AI'dan gelen yanıt
Karar ağacı, orijinal veri kümesini ardışık olarak alt kümelere bölerek inşa edilir ve bu alt kümeler ağacın düğümleri haline gelir. Her adımda, bir özellik ve bir eşik (sayısal özellikler için) seçilir ve veriler, hedef değişkenle ilgili olarak elde edilen alt kümelerin homojenliğini (temizliğini) maksimize edecek şekilde bölünür.
Ana bölme kriterleri:
-
Gini indeks (Gini impurity) — rastgele seçilen bir nesnenin yanlış sınıflandırılma olasılığını ölçer, eğer nesne rastgele sınıflandırılırsa, alt kümedeki sınıf dağılımına göre. Ne kadar düşükse, o kadar iyidir.
-
Bilgi kazancı (Information Gain) — bölmeden önce ve sonra entropi farkı. Bilgi kazancı ne kadar büyükse, bölme o kadar iyidir.
-
Bilgi Kazancı Oranı (Information Gain Ratio) — bilgi kazancının, çok sayıda değere sahip özelliklere karşı önyargıyı önlemek için alt kümelerin sayısı ve boyutunu dikkate alan modifikasyonu.
-
Varyans azaltma (Variance reduction) — regresyonlar için kullanılır, alt kümelerdeki hedef değişkenin değerlerindeki dağılımı minimize eder.
Basit bir özellik bazlı bölme örneği:
# En iyi bölmeyi seçmek için pseudokod
best_gain = 0
best_feature = None
for feature in features:
for threshold in possible_thresholds(feature):
left, right = split(data, feature, threshold)
gain = information_gain(data, left, right)
if gain > best_gain:
best_gain = gain
best_feature = (feature, threshold)