Qu'est-ce qu'un exemple adversarial et une attaque FGSM?
sobes.tech IA
Réponse de l'IA
Un exemple adversaire est une donnée d'entrée modifiée de manière à tromper un modèle d'apprentissage automatique et à le faire produire une conclusion erronée. Ces exemples ressemblent presque à des données normales pour un humain, mais provoquent un dysfonctionnement du modèle.
FGSM (Fast Gradient Sign Method) est l'une des méthodes les plus simples et populaires pour créer des exemples adversaires. Elle utilise les gradients de la fonction de perte du modèle par rapport à l'entrée pour ajouter une petite perturbation dans la direction qui maximise l'erreur du modèle. Formellement :
[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]
où :
- (X) est l'entrée originale,
- (\epsilon) est la magnitude de la perturbation,
- (J) est la fonction de perte,
- (\theta) sont les paramètres du modèle,
- (y) est l'étiquette vraie.
Ainsi, FGSM génère rapidement des exemples qui trompent efficacement le modèle, ce qui est important pour évaluer sa robustesse et développer des méthodes de protection.