Sobes.tech
Senior

Cos'è un esempio avversario e un attacco FGSM?

sobes.tech AI

Risposta dell'AI

Un esempio avversario è un dato di input modificato appositamente per ingannare un modello di apprendimento automatico e indurlo a fare una conclusione errata. Questi esempi sembrano quasi identici ai dati normali per un essere umano, ma causano un malfunzionamento del modello.

FGSM (Fast Gradient Sign Method) è uno dei metodi più semplici e popolari per creare esempi avversari. Utilizza i gradienti della funzione di perdita del modello rispetto all'input per aggiungere una piccola perturbazione nella direzione che massimizza l'errore del modello. Formalmente:

[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]

dove:

  • (X) è l'input originale,
  • (\epsilon) è la magnitudine della perturbazione,
  • (J) è la funzione di perdita,
  • (\theta) sono i parametri del modello,
  • (y) è l'etichetta vera.

In questo modo, FGSM genera rapidamente esempi che ingannano efficacemente il modello, il che è importante per valutare la sua robustezza e sviluppare metodi di protezione.