Comment fonctionne la protection jailbreak

Un classifieur IA dédié inspecte chaque prompt à la recherche de tentatives de jailbreak et d'injection de prompt, et les bloque avant qu'elles n'atteignent l'outil d'IA.

Un jailbreak est un prompt conçu pour qu'un outil d'IA ignore ses instructions — révèle son prompt système, désactive ses règles de sécurité, adopte un persona « sans restriction » ou livre des données qu'il devrait garder privées. Les attaques par injection de prompt fonctionnent de la même façon, mais cachent les instructions malveillantes dans un contenu qu'un utilisateur colle ou téléverse innocemment, comme un document ou un e-mail. Dans les deux cas, le risque est le même : un outil d'IA auquel vos équipes font confiance se fait manipuler pour laisser fuiter des données.

La protection jailbreak arrête ces prompts avant qu'ils ne partent vers l'outil d'IA.

Comment ça fonctionne

Lorsqu'elle est activée, chaque prompt passe par un classifieur IA dédié avant l'analyse des données sensibles. Il lit le texte du prompt ainsi que le texte des fichiers joints, en traitant l'ensemble comme des données non fiables — les instructions cachées dans le contenu ne sont jamais suivies, seulement analysées. Le classifieur recherche tout contenu qui tente de faire en sorte que l'IA cible :

  • ignore, contourne ou « oublie » ses instructions système ou développeur ;
  • désactive les filtres de sécurité, les garde-fous, les contrôles de politique ou la journalisation ;
  • adopte un persona de jailbreak — « DAN », « mode développeur », « mode sans restriction » et autres ;
  • révèle des prompts cachés, des identifiants ou des données privées ;
  • contourne les restrictions d'accès aux outils ou aux données pour exfiltrer des informations.

Le classifieur est volontairement conservateur. Écrire à propos des jailbreaks — recherche en sécurité, citation d'une attaque dans un rapport, question sur la prévention de l'injection de prompt, ou simple mention de « prompt système » — n'est pas signalé. Quand l'intention est ambiguë, il préfère laisser passer le prompt et laisser l'analyse des données sensibles juger le contenu.

Ce qui se passe en cas de détection

  • L'envoi est bloqué. La protection jailbreak bloque toujours à la détection — ce n'est pas un réglage Off/Alerter/Bloquer par politique, et une politique en Simulation ne l'adoucit pas.
  • L'utilisateur voit « Tentative de jailbreak bloquée », et le passage incriminé est remplacé par [JAILBREAK_ATTEMPT_REMOVED] dans l'aperçu anonymisé, afin que le reste du prompt puisse tout de même être envoyé en toute sécurité.
  • Un incident de sévérité haute est enregistré avec la catégorie d'attaque (contournement d'instructions, extraction de prompt système, contournement des protections, persona de jailbreak, exfiltration de données, abus d'outils), la confiance et le raisonnement du classifieur, ainsi qu'un extrait masqué du texte détecté.
  • Si un connecteur SIEM est configuré, l'événement y est diffusé comme n'importe quel autre incident.

Où le voir

La page Incidents comporte un compteur Tentatives de jailbreak dédié et un filtre en un clic, pour passer en revue chaque tentative à l'échelle de l'organisation — qui, quand, quel outil d'IA et ce que le prompt cherchait à faire.

Performance et activation

La protection jailbreak ajoute une seconde passe d'IA à chaque prompt, ce qui coûte quelques secondes de latence. À chaque organisation de décider si le compromis en vaut la peine :

  • ZeusLock Cloud — le réglage est géré par organisation par l'équipe ZeusLock. Contactez le support pour l'activer ou le désactiver.
  • Souverain / sur site — les propriétaires et administrateurs le contrôlent directement dans Paramètres → Comportement DLP → Protection jailbreak (IA), et une valeur par défaut à l'échelle du déploiement peut être définie à l'installation.

La désactiver ne retire que le classifieur de jailbreak — les règles par patterns et la détection IA des données sensibles ne sont pas affectées. Et elle ne devient jamais un point de défaillance unique : si le classifieur ne peut pas répondre, les prompts ne sont pas retardés — l'analyse des données sensibles s'exécute quand même et l'événement est marqué comme dégradé dans la piste d'audit.

Périmètre

La protection jailbreak s'applique aux prompts envoyés aux outils d'IA via l'extension de navigateur et l'agent desktop. Le trafic MCP est quant à lui protégé dans les deux sens par l'analyse des données sensibles — le classifieur de jailbreak cible ce que les personnes tapent et collent dans les outils de chat IA.