¿Qué es jailbreak y la inyección de indicaciones indirectas?
sobes.tech AI
Respuesta de la IA
Jailbreak en el contexto de modelos de IA es un método para sortear las restricciones o filtros incorporados en el modelo con el fin de hacer que realice acciones no deseadas o prohibidas. Por ejemplo, un usuario puede formular una solicitud de manera que el modelo revele información confidencial o genere código malicioso, a pesar de las restricciones integradas.
La inyección de prompts indirecta es una variante de ataques a modelos de IA, donde la entrada maliciosa no se inserta directamente en la solicitud, sino a través de canales indirectos, como datos que el modelo lee de fuentes externas (páginas web, documentos, etc.). De esta manera, un atacante puede influir en el comportamiento del modelo sin interactuar directamente con él.
Ambas técnicas pertenecen a la categoría de ataques adversariales y son importantes para garantizar la seguridad y la privacidad al usar IA.