Sobes.tech
Senior

Co je to adversariální příklad a útok FGSM?

sobes.tech AI

Odpověď od AI

Adversariální příklad je vstupní data, která jsou speciálně upravena tak, aby uvedla model strojového učení v omyl a přiměla jej k chybovému závěru. Tyto příklady vypadají téměř identicky s běžnými daty pro člověka, ale způsobují nesprávnou funkci modelu.

FGSM (Fast Gradient Sign Method) je jednou z nejjednodušších a nejpopulárnějších metod tvorby adversariálních příkladů. Používá gradienty ztrátové funkce modelu vzhledem ke vstupu k přidání malé narušení ve směru, který maximalizuje chybu modelu. Formálně:

[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]

kde:

  • (X) je původní vstup,
  • (\epsilon) je velikost narušení,
  • (J) je ztrátová funkce,
  • (\theta) jsou parametry modelu,
  • (y) je pravdivá značka.

Tímto způsobem FGSM rychle generuje příklady, které efektivně oklamou model, což je důležité pro hodnocení jeho odolnosti a vývoj ochranných metod.