Sobes.tech
Senior

FSDP (Fully Sharded Data Parallel) nədir?

sobes.tech Süni İntellekt

AI-dan cavab

Fully Sharded Data Parallel (FSDP) — bu, neyron şəbəkələrinin paylanmış təlim üsuludur və model parametrləri, gradientlər və optimizator vəziyyətləri tamamilə bütün mövcud GPU-lər arasında shard (bölünür). Ənənəvi Data Parallel-dan fərqli olaraq, burada hər GPU modelin tam nüsxəsini saxlamaq yerinə, onu hissələrə bölür və cihazlar arasında paylayır, bu da hər GPU-da yaddaş tələblərini əhəmiyyətli dərəcədə azaldır və çox böyük modellərin təlimini mümkün edir.

FSDP-nin əsas üstünlükləri:

  • Parametrlər və optimizator vəziyyətlərinin shard edilməsi ilə yaddaş qənaəti.
  • Bir GPU yaddaşına sığmayan modellərin təlimi.
  • Cihazlar arasında hesablama və kommunikasiya effektiv paylanması.

Əsasən proses belə işləyir: model qatlara və ya bloklara bölünür, hər biri ayrı GPU-da saxlanılır. Düz və geri keçid zamanı, lazım olan tensorlar cihazlar arasında dəyişdirilir və parametr yeniləmələri hər shard edilmiş parçada lokal olaraq həyata keçirilir.

FSDP, PyTorch kimi müasir çərçivələrdə tez-tez istifadə olunur və çox GPU-lu klasterlərdə böyük modellərin təlimini genişləndirmək üçün istifadə edilir.