O que é um exemplo adversarial e um ataque FGSM?
sobes.tech IA
Resposta da IA
Um exemplo adversarial é um dado de entrada modificado especificamente para enganar um modelo de aprendizagem automática e fazer com que produza uma conclusão incorreta. Estes exemplos parecem quase idênticos aos dados normais para um humano, mas causam um mau funcionamento do modelo.
FGSM (Fast Gradient Sign Method) é um dos métodos mais simples e populares para criar exemplos adversariais. Utiliza os gradientes da função de perda do modelo relativamente à entrada para adicionar uma pequena perturbação na direção que maximiza o erro do modelo. Formalmente:
[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]
onde:
- (X) é a entrada original,
- (\epsilon) é a magnitude da perturbação,
- (J) é a função de perda,
- (\theta) são os parâmetros do modelo,
- (y) é a etiqueta verdadeira.
Desta forma, o FGSM gera rapidamente exemplos que enganam eficazmente o modelo, o que é importante para avaliar a sua robustez e desenvolver métodos de proteção.