როგორ მიმდინარეობს გადაწყვეტილების ხის მშენებლობის პროცესი? რა განყოფილების კრიტერიუმებს იცნობთ?
sobes.tech AI
პასუხი AI-სგან
გადაწყვეტის ხე აშენებულია მონაცემთა საწყის ნაკადზე ეტაპობრივად დაყოფით, რომლებიც ხდებიან ხის ნამდვილი ნიშან-თვისებები. ყოველი ნაბიჯით, ირჩევა თვისება და ზღვარი (რაოდენობრივი თვისებებისთვის), რომლის მიხედვითაც მონაცემები ნაწილებად იყოფა, რათა მაქსიმალურად გაიზარდოს მიღებული ნაწილების ერთგვაროვნება (სუფთაობა) მიზნობრივი ცვლადის მიმართ.
ძირითადი დაყოფის კრიტერიუმები:
-
Gini ინდექსი (Gini impurity) — ზომავს შემთხვევით შერჩეული ობიექტის შეცდომით კლასიფიკაციის ალბათობას, თუ ის შემთხვევით კლასიფიცირდება კლასების განაწილების მიხედვით ნაწილში. რამდენადაც დაბალია, მით უკეთესია.
-
ინფორმაციის მოგება (Information Gain) — განსხვავება ენტროპიის დონეზე წინასა და შემდეგ. რამდენადაც მეტი, მით უკეთესი დაყოფა.
-
ინფორმაციის მოგების შეფარდება (Information Gain Ratio) — ცვლილება ინფორმაციის მოგებაში, რომელიც ითვალისწინებს ნაწილების რაოდენობას და ზომას, რათა თავიდან აიცილოს გადახრა თვისებებზე, რომლებსაც ბევრი მნიშვნელობა აქვთ.
-
ვარიაციის შემცირება (Variance reduction) — გამოიყენება რეგრესიაში, მინიმუმამდე ამცირებს მიზნობრივი ცვლადის მნიშვნელობების განაწილებას ნაწილებში.
სიმპლიური დაყოფის მაგალითი:
# საუკეთესო დაყოფის არჩევის псევდოკოდ
best_gain = 0
best_feature = None
for feature in features:
for threshold in possible_thresholds(feature):
left, right = split(data, feature, threshold)
gain = information_gain(data, left, right)
if gain > best_gain:
best_gain = gain
best_feature = (feature, threshold)