Czym jest jailbreak i wstrzykiwanie pośredniego polecenia?
sobes.tech AI
Odpowiedź od AI
Jailbreak w kontekście modeli AI to metoda obejścia wbudowanych ograniczeń lub filtrów modelu, mająca na celu zmuszenie go do wykonywania niepożądanych lub zabronionych działań. Na przykład użytkownik może sformułować zapytanie tak, aby model ujawnił poufne informacje lub wygenerował złośliwy kod, pomimo wbudowanych ograniczeń.
Pośrednia injekcja promptów to odmiana ataków na modele AI, gdy złośliwe dane nie są wprowadzane bezpośrednio do zapytania, lecz przez kanały pośrednie, np. dane odczytywane przez model z zewnętrznych źródeł (strony internetowe, dokumenty itp.). W ten sposób atakujący może wpłynąć na zachowanie modelu bez bezpośredniego kontaktu z nim.
Obie techniki należą do kategorii ataków adversarialnych i są ważne dla zapewnienia bezpieczeństwa i prywatności podczas korzystania z AI.