¿Qué es un ejemplo adversarial y un ataque FGSM?
sobes.tech AI
Respuesta de la IA
Un ejemplo adversarial es un dato de entrada modificado específicamente para engañar a un modelo de aprendizaje automático y hacer que produzca una conclusión errónea. Estos ejemplos parecen casi idénticos a los datos normales para un humano, pero provocan un mal funcionamiento del modelo.
FGSM (Fast Gradient Sign Method) es uno de los métodos más simples y populares para crear ejemplos adversariales. Utiliza los gradientes de la función de pérdida del modelo respecto a la entrada para añadir una pequeña perturbación en la dirección que maximiza el error del modelo. Formalmente:
[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]
donde:
- (X) es la entrada original,
- (\epsilon) es la magnitud de la perturbación,
- (J) es la función de pérdida,
- (\theta) son los parámetros del modelo,
- (y) es la etiqueta verdadera.
De esta manera, FGSM genera rápidamente ejemplos que engañan eficazmente al modelo, lo cual es importante para evaluar su robustez y desarrollar métodos de protección.