Čo je to adversariálny príklad a útok FGSM?
sobes.tech AI
Odpoveď od AI
Adversariálny príklad je vstupné údaje, ktoré sú špeciálne upravené tak, aby uviedli model strojového učenia do omylu a viedli ho k nesprávnemu záveru. Takéto príklady vyzerajú takmer identicky s bežnými údajmi pre človeka, ale spôsobujú nesprávnu funkciu modelu.
FGSM (Fast Gradient Sign Method) je jednou z najjednoduchších a najpopulárnejších metód tvorby adversariálnych príkladov. Používa gradienty strátovej funkcie modelu voči vstupu na pridanie malej narušenia v smere, ktorý maximalizuje chybu modelu. Formálne:
[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]
kde:
- (X) je pôvodný vstup,
- (\epsilon) je veľkosť narušenia,
- (J) je funkcia straty,
- (\theta) sú parametre modelu,
- (y) je pravdivá značka.
Týmto spôsobom FGSM rýchlo generuje príklady, ktoré efektívne oklamú model, čo je dôležité pre hodnotenie jeho odolnosti a vývoj ochranných metód.