Qu'est-ce que le jailbreak et l'injection de prompt indirecte?
sobes.tech IA
Réponse de l'IA
Jailbreak dans le contexte des modèles d'IA est une méthode pour contourner les restrictions ou filtres intégrés au modèle afin de le faire effectuer des actions indésirables ou interdites. Par exemple, un utilisateur peut formuler une requête de manière à ce que le modèle révèle des informations confidentielles ou génère du code malveillant, malgré les restrictions intégrées.
L'injection de prompt indirecte est une variante d'attaques contre les modèles d'IA, où l'entrée malveillante n'est pas insérée directement dans la requête, mais via des canaux indirects, comme des données que le modèle lit de sources externes (pages web, documents, etc.). Ainsi, un attaquant peut influencer le comportement du modèle sans interagir directement avec lui.
Les deux techniques appartiennent à la catégorie des attaques adversariales et sont importantes pour assurer la sécurité et la confidentialité lors de l'utilisation de l'IA.