Banana Navy
Catalogue EN
Lab · Threat modeling IA · Fiche détaillée

Jailbreak et bypass des garde-fous

contournement des garde-fous par formulations adverses (rôles, négociation, encodages) pour sortir le modèle de sa politique.

FicheF17
CatégorieAI3-TB7 (jailbreak)
Couches10 · Prompt Injection Filter
Systèmevoicebot IA

distinguer compromission du LLM de compromission du système : accepter qu'un jailbreak produise du texte hors politique, mais garantir que des contrôles externes bornent les conséquences (actions, données, décisions critiques hors de la génération libre).

La menace

contournement des garde-fous par formulations adverses (rôles, négociation, encodages) pour sortir le modèle de sa politique.

Angle mortPourquoi les grilles classiques la ratent

c'est une attaque sur la politique du modèle, pas sur un composant ; fréquente, difficile à éradiquer par simple renforcement d'instructions.

MitigationSolution proposée

distinguer compromission du LLM de compromission du système : accepter qu'un jailbreak produise du texte hors politique, mais garantir que des contrôles externes bornent les conséquences (actions, données, décisions critiques hors de la génération libre).

Le contrôle proposé
les actions et décisions critiques restent hors de la génération libre.

Preuve attendue
démontrer qu'un jailbreak réussi ne débouche sur aucune action critique non soumise aux contrôles.

SourcesRéférences et recherche publique

MITRE ATLAS 2026.07AML.T0054 LLM Jailbreak
Recherche publiqueSources de recherche publiques : MITRE ATLAS 2026.07 (mapping technique vérifié), OWASP GenAI (catégories par abus de modèle), et le gabarit public risk-voicebot (aivansoul/risk-voicebot) qui définit les 20 checkpoints. Aucune donnée de registre client : fiche générique, sans cote ni verdict.
couche 10 · Prompt Injection Filter

Lire les 20 couches de sécurité

MITRE ATLAS 2026.07 · OWASP GenAI · risk-voicebot