Wat is een adversarial voorbeeld en een FGSM-aanval?
sobes.tech AI
Antwoord van AI
Een adversarial voorbeeld is invoergegevens die opzettelijk zodanig zijn aangepast dat ze een machine learning-model misleiden en het tot een foutieve conclusie brengen. Deze voorbeelden lijken bijna identiek aan normale gegevens voor een mens, maar veroorzaken een fout in het model.
FGSM (Fast Gradient Sign Method) is een van de eenvoudigste en populairste methoden om adversarial voorbeelden te maken. Het gebruikt de gradiënten van de verliesfunctie van het model ten opzichte van de invoer om een kleine verstoring toe te voegen in de richting die de fout van het model maximaliseert. Formeel:
[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]
waar:
- (X) de originele invoer is,
- (\epsilon) de grootte van de verstoring,
- (J) de verliesfunctie,
- (\theta) de modelparameters,
- (y) het ware label.
Op deze manier genereert FGSM snel voorbeelden die het model effectief misleiden, wat belangrijk is voor het beoordelen van de robuustheid en het ontwikkelen van beschermingsmethoden.