Ինչպես է տեղի ունենում որոշումների ծառի կառուցման գործընթացը: Ի՞նչ բաժանման չափանիշներ եք գիտակցում։
sobes.tech AI
Պատասխան AI-ից
Ներմուծման որոշումային ծառը կառուցվում է սկզբնական տվյալների հավաքածուի հերթական բաժանմամբ ենթահավաքների, որոնք դառնում են ծառի հանգույցները։ Յուրաքանչյուր քայլում ընտրվում է հատկություն և շեմ (համարային հատկությունների համար), որոնցով տվյալները բաժանվում են մասերի՝ առավելագույնի հասցնելու համար ստացված ենթահավաքների միօրինակությունը (մաքրությունը) նպատակային փոփոխականի նկատմամբ։
Հիմնական բաժանման չափանիշներ՝
-
Gini ցուցիչ (Gini impurity) — չափում է պատահական ընտրված օբյեկտի սխալ դասակարգման հավանականությունը, եթե այն դասակարգվի պատահականորեն ըստ ենթահավաքի դասերի բաշխման։ Որքան ցածր, այնքան լավ։
-
Տեղեկատվական շահույթ (Information Gain) — բաժանման առաջ և հետո էնտրոպիայի տարբերությունը։ Որքան մեծ է տեղեկատվական շահույթը, այնքան լավ է բաժանումը։
-
Տեղեկատվական շահույթի հարաբերակցություն (Information Gain Ratio) — փոփոխություն է տեղեկատվական շահույթի, որը հաշվի է առնում ենթահավաքների քանակը և չափը՝ կանխելու համար կողմնակալությունը մեծ արժեքներ ունեցող հատկությունների նկատմամբ։
-
Տարբերության նվազեցում (Variance reduction) — օգտագործվում է ռեգրեսիայում, նվազեցնում է նպատակային փոփոխականի արժեքների տարածվածությունը ենթահավաքներում։
Պարզ բաժանման օրինակ՝ ըստ հատկության:
# Պսևդոկոդ՝ լավագույն բաժանման ընտրության համար
best_gain = 0
best_feature = None
for feature in features:
for threshold in possible_thresholds(feature):
left, right = split(data, feature, threshold)
gain = information_gain(data, left, right)
if gain > best_gain:
best_gain = gain
best_feature = (feature, threshold)