Czym jest przykład adversarialny i atak FGSM?
sobes.tech AI
Odpowiedź od AI
Przykład adwersarialny to dane wejściowe specjalnie zmodyfikowane w taki sposób, aby wprowadzić w błąd model uczenia maszynowego i skłonić go do błędnego wniosku. Takie przykłady wyglądają prawie identycznie jak zwykłe dane dla człowieka, ale powodują nieprawidłowe działanie modelu.
FGSM (Fast Gradient Sign Method) jest jednym z najprostszych i najpopularniejszych metod tworzenia przykładów adwersarialnych. Wykorzystuje gradient funkcji straty modelu względem wejścia, aby dodać niewielkie zakłócenie w kierunku maksymalizującym błąd modelu. Formalnie:
[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]
gdzie:
- (X) to dane wejściowe,
- (\epsilon) to wielkość zakłócenia,
- (J) to funkcja straty,
- (\theta) to parametry modelu,
- (y) to prawdziwa etykieta.
W ten sposób FGSM szybko generuje przykłady, które skutecznie oszukują model, co jest ważne dla oceny jego odporności i rozwoju metod ochrony.