Sobes.tech
Middle — Senior

Was sind adversarielle Beispiele und FGSM-Angriffe?

sobes.tech KI

Antwort von AI

Adversarielle Beispiele sind speziell erstellte Eingabedaten für Modelle des maschinellen Lernens, die fast identisch mit normalen Daten aussehen, aber das Modell dazu bringen, falsch zu klassifizieren oder falsche Entscheidungen zu treffen. Solche Beispiele zeigen Schwachstellen neuronaler Netze.

FGSM (Fast Gradient Sign Method) ist eine der einfachen und beliebten Methoden zur Erstellung adversarialer Beispiele. Die Idee ist, dem ursprünglichen Bild eine kleine Verzerrung in Richtung des Gradienten der Verlustfunktion bezüglich der Eingabe hinzuzufügen, was den Fehler des Modells maximiert.

Formel für FGSM:

x_{adv} = x + \epsilon \cdot \text{sign}(\nabla_x J(\theta, x, y))

wobei:

  • x das ursprüngliche Bild ist,
  • \epsilon eine kleine Zahl ist, die die Größe der Verzerrung kontrolliert,
  • J die Verlustfunktion ist,
  • \theta die Modellparameter sind,
  • y die korrekte Beschriftung ist.

Auf diese Weise generiert FGSM schnell ein Beispiel, das das Modell in die Irre führt, was wichtig ist, um die Robustheit und Sicherheit der Modelle zu bewerten.