Sobes.tech
Middle — Senior

Miért foglal több memóriát a modell az edzés során, mint az inference során?

sobes.tech MI

Válasz az MI-től

A tanulási szakaszban a modell több okból is több memóriát foglal el:

  1. Gradiensok tárolása: A tanulás során szükséges minden paraméterhez gradiens tárolása, hogy a súlyokat a visszaterjesztés (backpropagation) algoritmusa segítségével frissíthessük. Az inferenciában a gradiens nem szükséges.

  2. Közbenső aktivációk: A gradiens számításához szükséges az összes réteg közbenső aktivációs értékeinek tárolása, ami növeli a memóriaigényt.

  3. Optimalizálók: Néhány optimalizáló (például Adam) további paramétereket tárol, mint az első és második rendű momentumok, ami növeli a memória mennyiségét.

  4. Batch adatok: A tanulás során gyakran nagy adathalmazokat használnak, ami szintén további memóriát igényel.

Összefoglalva, az inferenciában a modell egyszerűen végrehajt egy közvetlen átvitelt, nem tárol gradiens értékeket vagy közbenső értékeket a visszaterjesztéshez, ami jelentősen csökkenti a memória felhasználást.