Sobes.tech
Middle — Senior

როგორ განვსაზღვროთ ზარალის ფუნქციის დერივატივი logloss და MSE-ისთვის?

sobes.tech AI

პასუხი AI-სგან

მანქანათმცოდნეობაში ზარალის ფუნქციებისთვის ხშირად საჭიროა დერივატის (გრადიენტის) გამოთვლა მოდელის ოპტიმიზაციისთვის.

  1. MSE (საშუალო კვადრატული შეცდომა) — საშუალო კვადრატული შეცდომა:

ზარალის ფუნქცია:

[ L = \frac{1}{n} \sum_{i=1}^n (y_i - \hat{y}_i)^2 ]

დერივატივი პროგნოზთან ( \hat{y}_i ):

[ \frac{\partial L}{\partial \hat{y}_i} = -\frac{2}{n} (y_i - \hat{y}_i) ]

  1. LogLoss (ლოგარითმული ზარალის ფუნქცია) — გამოიყენება კლასიფიკაციის დავალებებში (მაგალითად, ლოგისტიკური რეგრესიით):

ბინარული კლასიფიკაციისთვის:

[ L = -\frac{1}{n} \sum_{i=1}^n \left[ y_i \log(\hat{y}_i) + (1 - y_i) \log(1 - \hat{y}_i) \right] ]

სადაც ( y_i \in {0,1} ), ( \hat{y}_i ) არის წინასწარ გამოთვლილი ალბათობა კლასი 1-ისთვის.

დერივატივი ( \hat{y}_i )-ზე:

[ \frac{\partial L}{\partial \hat{y}_i} = -\frac{1}{n} \left( \frac{y_i}{\hat{y}_i} - \frac{1 - y_i}{1 - \hat{y}_i} \right) ]

ლოგისტიკური რეგრესიის კონტექსტში, თუ ( \hat{y}_i = \sigma(z_i) ) (სიგმოიდი), მაშინ დერივატი დამოკიდებულია მოდულის შესვლაზე ( z_i ):

[ \frac{\partial L}{\partial z_i} = \hat{y}_i - y_i ]

ეს გამარტივებს გამოთვლებს ტრენინგის დროს.

ამიტომ, მოდელის ოპტიმიზაციისთვის აუცილებელია ამ დერივატების გამოყენება პარამეტრების განახლებისთვის გრადიენტული მეთოდებით.