Sobes.tech
Senior

O que é um exemplo adversarial e um ataque FGSM?

sobes.tech IA

Resposta da IA

Um exemplo adversarial é um dado de entrada modificado especificamente para enganar um modelo de aprendizagem automática e fazer com que produza uma conclusão incorreta. Estes exemplos parecem quase idênticos aos dados normais para um humano, mas causam um mau funcionamento do modelo.

FGSM (Fast Gradient Sign Method) é um dos métodos mais simples e populares para criar exemplos adversariais. Utiliza os gradientes da função de perda do modelo relativamente à entrada para adicionar uma pequena perturbação na direção que maximiza o erro do modelo. Formalmente:

[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]

onde:

  • (X) é a entrada original,
  • (\epsilon) é a magnitude da perturbação,
  • (J) é a função de perda,
  • (\theta) são os parâmetros do modelo,
  • (y) é a etiqueta verdadeira.

Desta forma, o FGSM gera rapidamente exemplos que enganam eficazmente o modelo, o que é importante para avaliar a sua robustez e desenvolver métodos de proteção.