Was ist ein adversariales Beispiel und ein FGSM-Angriff?
sobes.tech KI
Antwort von AI
Ein adversariales Beispiel ist eine speziell modifizierte Eingabe, um ein maschinelles Lernmodell in die Irre zu führen und es zu einer fehlerhaften Schlussfolgerung zu verleiten. Solche Beispiele sehen für einen Menschen fast identisch mit normalen Daten aus, führen jedoch zu Fehlfunktionen des Modells.
FGSM (Fast Gradient Sign Method) ist eine der einfachsten und beliebtesten Methoden zur Erstellung adversarialer Beispiele. Es nutzt die Gradienten der Verlustfunktion des Modells bezüglich der Eingabe, um eine kleine Störung in Richtung zuzufügen, die den Fehler des Modells maximiert. Formal:
[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]
wobei:
- (X) die ursprüngliche Eingabe ist,
- (\epsilon) die Störungsgröße,
- (J) die Verlustfunktion,
- (\theta) die Modellparameter,
- (y) die wahre Beschriftung.
Auf diese Weise generiert FGSM schnell Beispiele, die das Modell effektiv täuschen, was wichtig ist, um seine Robustheit zu bewerten und Schutzmethoden zu entwickeln.