Jak funguje gradientní sestup pro hledání parametrů modelu?
sobes.tech AI
Odpověď od AI
Sestup gradientu je iteratívny optimalizačný algoritmus používaný na nájdenie parametrov modelu, ktoré minimalizujú funkciu straty. Myšlienka spočíva v tom, že krok za krokom upravujeme parametre v smere opaku gradientu funkcie straty, pretože gradient ukazuje smer najväčšieho nárastu.
Proces vyzerá takto:
-
Inicializujeme parametre modelu náhodnými hodnotami.
-
Vypočítame gradient funkcie straty vzhľadom na parametre — vektor čiastkových derivácií.
-
Aktualizujeme parametre pohybom v smere znižovania funkcie straty:
( \theta := \theta - \alpha \nabla L(\theta) )
kde ( \alpha ) je rýchlosť učenia.
-
Opakujeme kroky 2-3 až do konvergencie alebo dosiahnutia maximálneho počtu iterácií.
Príklad v Pythone s numpy:
import numpy as np
def gradient_descent(x, y, theta, learning_rate, iterations):
m = len(y)
for _ in range(iterations):
predictions = x.dot(theta)
errors = predictions - y
gradient = (1/m) * x.T.dot(errors)
theta = theta - learning_rate * gradient
return theta
# x — matica znakov, y — cieľová premenná, theta — parametre modelu
Takto gradientný zostup umožňuje nájsť optimálne parametre minimalizáciou chyby modelu.