Co je to adversariální příklad a útok FGSM?
sobes.tech AI
Odpověď od AI
Adversariální příklad je vstupní data, která jsou speciálně upravena tak, aby uvedla model strojového učení v omyl a přiměla jej k chybovému závěru. Tyto příklady vypadají téměř identicky s běžnými daty pro člověka, ale způsobují nesprávnou funkci modelu.
FGSM (Fast Gradient Sign Method) je jednou z nejjednodušších a nejpopulárnějších metod tvorby adversariálních příkladů. Používá gradienty ztrátové funkce modelu vzhledem ke vstupu k přidání malé narušení ve směru, který maximalizuje chybu modelu. Formálně:
[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]
kde:
- (X) je původní vstup,
- (\epsilon) je velikost narušení,
- (J) je ztrátová funkce,
- (\theta) jsou parametry modelu,
- (y) je pravdivá značka.
Tímto způsobem FGSM rychle generuje příklady, které efektivně oklamou model, což je důležité pro hodnocení jeho odolnosti a vývoj ochranných metod.