Mi az adversáriális példa és FGSM támadás?
sobes.tech MI
Válasz az MI-től
Az adversáriális példa olyan bemeneti adat, amelyet kifejezetten úgy módosítottak, hogy megtévessze a gépi tanulási modellt, és hibás következtetésre késztessék. Ezek a példák szinte azonosak az ember számára a normál adatokkal, de hibás működést okoznak a modellben.
Az FGSM (Fast Gradient Sign Method) az egyik legegyszerűbb és legnépszerűbb módszer az adversáriális példák létrehozására. A modell veszteségfüggvényének gradiensét használja a bemenetre vonatkozóan, hogy egy kis zavaró tényezőt adjon hozzá, amely maximalizálja a modell hibáját. Formálisan:
[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]
ahol:
- (X) az eredeti bemenet,
- (\epsilon) a zavaró tényező nagysága,
- (J) a veszteségfüggvény,
- (\theta) a modell paraméterei,
- (y) a valódi címke.
Így az FGSM gyorsan generál olyan példákat, amelyek hatékonyan megtévesztik a modellt, ami fontos a modell robusztusságának értékelésében és védelmi módszerek fejlesztésében.