Sobes.tech
Junior — Middle

როგორ მიმდინარეობს გადაწყვეტილების ხის მშენებლობის პროცესი? რა განყოფილების კრიტერიუმებს იცნობთ?

sobes.tech AI

პასუხი AI-სგან

გადაწყვეტის ხე აშენებულია მონაცემთა საწყის ნაკადზე ეტაპობრივად დაყოფით, რომლებიც ხდებიან ხის ნამდვილი ნიშან-თვისებები. ყოველი ნაბიჯით, ირჩევა თვისება და ზღვარი (რაოდენობრივი თვისებებისთვის), რომლის მიხედვითაც მონაცემები ნაწილებად იყოფა, რათა მაქსიმალურად გაიზარდოს მიღებული ნაწილების ერთგვაროვნება (სუფთაობა) მიზნობრივი ცვლადის მიმართ.

ძირითადი დაყოფის კრიტერიუმები:

  • Gini ინდექსი (Gini impurity) — ზომავს შემთხვევით შერჩეული ობიექტის შეცდომით კლასიფიკაციის ალბათობას, თუ ის შემთხვევით კლასიფიცირდება კლასების განაწილების მიხედვით ნაწილში. რამდენადაც დაბალია, მით უკეთესია.

  • ინფორმაციის მოგება (Information Gain) — განსხვავება ენტროპიის დონეზე წინასა და შემდეგ. რამდენადაც მეტი, მით უკეთესი დაყოფა.

  • ინფორმაციის მოგების შეფარდება (Information Gain Ratio) — ცვლილება ინფორმაციის მოგებაში, რომელიც ითვალისწინებს ნაწილების რაოდენობას და ზომას, რათა თავიდან აიცილოს გადახრა თვისებებზე, რომლებსაც ბევრი მნიშვნელობა აქვთ.

  • ვარიაციის შემცირება (Variance reduction) — გამოიყენება რეგრესიაში, მინიმუმამდე ამცირებს მიზნობრივი ცვლადის მნიშვნელობების განაწილებას ნაწილებში.

სიმპლიური დაყოფის მაგალითი:

# საუკეთესო დაყოფის არჩევის псევდოკოდ
best_gain = 0
best_feature = None
for feature in features:
    for threshold in possible_thresholds(feature):
        left, right = split(data, feature, threshold)
        gain = information_gain(data, left, right)
        if gain > best_gain:
            best_gain = gain
            best_feature = (feature, threshold)