Sobes.tech
Senior

Wat is jailbreak en indirect prompt injectie?

sobes.tech AI

Antwoord van AI

Jailbreak in de context van AI-modellen is een methode om ingebouwde beperkingen of filters van het model te omzeilen om het model onwenselijke of verboden acties te laten uitvoeren. Bijvoorbeeld, een gebruiker kan een verzoek formuleren zodat het model vertrouwelijke informatie onthult of schadelijke code genereert, ondanks de ingebouwde beperkingen.

Indirecte prompt-injectie is een variant van aanvallen op AI-modellen, waarbij schadelijke invoer niet rechtstreeks in het verzoek wordt ingebracht, maar via indirecte kanalen, zoals gegevens die het model leest uit externe bronnen (webpagina's, documenten, enz.). Op deze manier kan een aanvaller het gedrag van het model beïnvloeden zonder direct met het te communiceren.

Beide technieken behoren tot de categorie van adversariale aanvallen en zijn belangrijk voor het waarborgen van veiligheid en privacy bij het gebruik van AI.