Cómo funciona la protección contra jailbreak
Un clasificador de IA dedicado inspecciona cada prompt en busca de intentos de jailbreak e inyección de prompt, y los bloquea antes de que lleguen a la herramienta de IA.
Un jailbreak es un prompt diseñado para que una herramienta de IA ignore sus instrucciones: revelar su prompt del sistema, desactivar sus reglas de seguridad, adoptar una persona «sin restricciones» o entregar datos que debería mantener privados. Los ataques de inyección de prompt funcionan igual, pero esconden las instrucciones maliciosas dentro de contenido que un usuario pega o sube de forma inocente, como un documento o un correo. En ambos casos el riesgo es el mismo: una herramienta de IA en la que su gente confía es manipulada para filtrar datos.
La protección contra jailbreak detiene estos prompts antes de que salgan hacia la herramienta de IA.
Cómo funciona
Cuando está activada, cada prompt pasa por un clasificador de IA dedicado antes del análisis de datos sensibles. El clasificador lee el texto del prompt y el texto de los archivos adjuntos, tratándolo todo como datos no confiables — las instrucciones escondidas dentro del contenido nunca se siguen, solo se analizan. Busca contenido que intente que la IA de destino:
- Ignore, anule u «olvide» sus instrucciones de sistema o de desarrollador.
- Desactive filtros de seguridad, salvaguardas, comprobaciones de políticas o el registro de actividad.
- Adopte una persona de jailbreak — «DAN», «modo desarrollador», «modo sin restricciones» y similares.
- Revele prompts ocultos, credenciales o datos privados.
- Eluda restricciones de herramientas o de acceso a datos para exfiltrar información.
El clasificador es deliberadamente conservador. Escribir sobre jailbreaks — investigación de seguridad, citar un ataque en un informe, preguntar cómo prevenir la inyección de prompt o simplemente mencionar «prompt del sistema» — no se marca. Cuando la intención es ambigua, prefiere dejar pasar el prompt y que sea el análisis de datos sensibles el que juzgue el contenido.
Qué ocurre al detectar un intento
- El envío se bloquea. La protección contra jailbreak siempre bloquea al detectar — no es un conmutador Off/Alertar/Bloquear por política, y una política en Simulación no la suaviza.
- El usuario ve «Intento de jailbreak bloqueado» y el pasaje infractor se sustituye por
[JAILBREAK_ATTEMPT_REMOVED]en la vista previa anonimizada, de modo que el resto del prompt aún puede enviarse con seguridad. - Se registra un incidente de severidad alta con la categoría del ataque (anulación de instrucciones, extracción del prompt del sistema, elusión de seguridad, persona de jailbreak, exfiltración de datos, abuso de herramientas), la confianza y el razonamiento del clasificador, y un extracto enmascarado del texto detectado.
- Si hay un conector SIEM configurado, el evento se transmite allí como cualquier otro incidente.
Dónde lo ve
La página Incidentes tiene un contador dedicado de Intentos de jailbreak y un filtro de un solo clic, para revisar cada intento en toda la organización — quién, cuándo, con qué herramienta de IA y qué intentaba hacer el prompt.
Rendimiento y el interruptor de activación
La protección contra jailbreak añade una segunda pasada de IA a cada prompt, lo que cuesta unos segundos de latencia. Que ese intercambio merezca la pena es una decisión de cada organización:
- ZeusLock Cloud — el ajuste lo gestiona por organización el equipo de ZeusLock. Contacte con soporte para activarlo o desactivarlo.
- Soberano / on-premises — los propietarios y administradores lo controlan directamente en Ajustes → Comportamiento DLP → Protección jailbreak (IA), y puede definirse un valor predeterminado para todo el despliegue en el momento de la instalación.
Desactivarla solo elimina el clasificador de jailbreaks — las reglas de patrones y la detección de datos sensibles basada en IA no se ven afectadas. Y nunca se convierte en un punto único de fallo: si el clasificador no puede responder, los prompts no se quedan bloqueados — el análisis de datos sensibles se ejecuta igualmente y el evento se marca como degradado en el registro de auditoría.
Alcance
La protección contra jailbreak se aplica a los prompts enviados a herramientas de IA a través de la extensión de navegador y del agente de escritorio. El tráfico MCP se protege en cambio con el análisis de datos sensibles en ambas direcciones — el clasificador de jailbreaks se centra en lo que las personas escriben y pegan en las herramientas de chat de IA.