Adversarial örnek ve FGSM saldırısı nedir?
sobes.tech yapay zeka
AI'dan gelen yanıt
Adversarial örnek, makine öğrenimi modelini yanıltmak ve yanlış bir sonuç üretmesine neden olmak üzere özel olarak değiştirilmiş giriş verisidir. Bu örnekler, insanlar için neredeyse aynı görünen normal verilere çok benzese de, modelin düzgün çalışmamasına neden olur.
FGSM (Fast Gradient Sign Method), adversarial örnekler oluşturmanın en basit ve popüler yöntemlerinden biridir. Modelin kayıp fonksiyonunun girişe göre gradyanlarını kullanarak, model hatasını en çok artıran yönde küçük bir bozulma ekler. Formal olarak:
[ X_{adv} = X + \epsilon \cdot \text{sign}(\nabla_X J(\theta, X, y)) ]
Burada:
- (X) orijinal giriş,
- (\epsilon) bozulma büyüklüğü,
- (J) kayıp fonksiyonu,
- (\theta) model parametreleri,
- (y) gerçek etiket.
Bu şekilde, FGSM hızlıca, modeli etkili bir şekilde kandıran örnekler üretir, bu da modelin dayanıklılığını değerlendirmek ve koruma yöntemleri geliştirmek için önemlidir.