Sobes.tech
Senior

FSDP (Fully Sharded Data Parallel) nedir?

sobes.tech yapay zeka

AI'dan gelen yanıt

Fully Sharded Data Parallel (FSDP) — bu, derki neural ağların dağıtılmış eğitimi yöntemidir ve model parametreleri, gradyanlar ve optimizasyon durumu tamamen tüm mevcut GPU’lar arasında shard’lanır (bölünür). Geleneksel Data Parallel’dan farklı olarak, burada her GPU modelin tam bir kopyasını tutmak yerine, modeli parçalara ayırır ve cihazlar arasında dağıtır, bu da her GPU’daki bellek gereksinimini önemli ölçüde azaltır ve çok büyük modellerin eğitimine olanak tanır.

FSDP’nin temel avantajları:

  • Parametreler ve optimizasyon durumu shard’lanmasıyla bellek tasarrufu.
  • Tek bir GPU’nun belleğine sığmayan modellerin eğitimi.
  • Cihazlar arasında hesaplama ve iletişimin verimli dağılımı.

Genellikle süreç şu şekildedir: model katmanlara veya bloklara bölünür, her biri ayrı bir GPU’da saklanır. Doğrudan ve geri yayılım sırasında, gerekli tensörler cihazlar arasında değiştirilir ve parametre güncellemeleri her shard’lı parça üzerinde yerel olarak yapılır.

FSDP, PyTorch gibi modern framework’lerde sıklıkla kullanılır ve çok GPU’lu kümelerde büyük modellerin eğitimini ölçeklendirmek için kullanılır.