Sobes.tech
Senior

¿Qué es un ejemplo adversarial y un ataque FGSM?

sobes.tech AI

Respuesta de la IA

Un ejemplo adversarial es un dato de entrada modificado específicamente para engañar a un modelo de aprendizaje automático y hacer que produzca una conclusión errónea. Estos ejemplos parecen casi idénticos a los datos normales para un humano, pero provocan un mal funcionamiento del modelo.

FGSM (Fast Gradient Sign Method) es uno de los métodos más simples y populares para crear ejemplos adversariales. Utiliza los gradientes de la función de pérdida del modelo respecto a la entrada para añadir una pequeña perturbación en la dirección que maximiza el error del modelo. Formalmente:

[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]

donde:

  • (X) es la entrada original,
  • (\epsilon) es la magnitud de la perturbación,
  • (J) es la función de pérdida,
  • (\theta) son los parámetros del modelo,
  • (y) es la etiqueta verdadera.

De esta manera, FGSM genera rápidamente ejemplos que engañan eficazmente al modelo, lo cual es importante para evaluar su robustez y desarrollar métodos de protección.