Sobes.tech
Senior

Mis on FSDP (Fully Sharded Data Parallel)?

sobes.tech AI

Vastus AI-lt

Fully Sharded Data Parallel (FSDP) — on meetod, kuidas jaotada närvivõrkude koolitust, kus mudeli parameetrid, gradientid ja optimeerija olekud on täielikult jagatud (sharditud) kõigi saadaval olevate GPU-de vahel. Erinevalt traditsioonilisest Data Parallelist, kus iga GPU hoiab kogu mudeli koopiat, jagab FSDP mudeli osadeks ja levitab need seadmete vahel, mis oluliselt vähendab iga GPU mäe nõudeid ning võimaldab koolitada väga suuri mudeleid.

FSDP peamised eelised:

  • Mälu kokkuhoid parameetrite ja optimeerija olekute shardimise kaudu.
  • Võimalus koolitada mudeleid, mis ei mahu ühe GPU mälu.
  • Tõhus arvutuste ja kommunikatsiooni jaotamine seadmete vahel.

Protsess näeb tavaliselt välja järgmiselt: mudel jagatakse kihtideks või plokkideks, millest igaüks salvestatakse eraldi GPU-l. Otse- ja tagasipääsul vahetatakse vajalikud tensorid seadmete vahel ning parameetrite uuendused tehakse lokaalselt iga sharditud fragmendi kohta.

FSDP-d kasutatakse sageli kaasaegsetes raamistikus nagu PyTorch, et suurendada suure mudeli koolitamise skaleeritavust mitme GPU klastrites.