Banana Navy
Catalogue EN
Lab · Threat modeling IA · Fiche détaillée

Injection directe de prompt

un utilisateur force le modèle à ignorer ses instructions en le lui demandant directement dans la conversation (« ignore previous instructions »).

FicheF15
CatégorieAI1-TB7 (prompt injection directe)
Couches10 · Prompt Injection Filter, 14 · LLM Interpretation
Systèmevoicebot IA

cloisonner les instructions (séparation système ou utilisateur) et surtout tester si l'injection atteint réellement un workflow critique : si la sortie toxique est bloquée en aval, la menace est contrainte.

La menace

un utilisateur force le modèle à ignorer ses instructions en le lui demandant directement dans la conversation (« ignore previous instructions »).

Angle mortPourquoi les grilles classiques la ratent

elles ne modélisent pas une entrée « conversation » dont le contenu a autorité sur le comportement du moteur de traitement.

MitigationSolution proposée

cloisonner les instructions (séparation système ou utilisateur) et surtout tester si l'injection atteint réellement un workflow critique : si la sortie toxique est bloquée en aval, la menace est contrainte.

Le contrôle proposé
aucune sortie non filtrée n'atteint un workflow critique.

Preuve attendue
trajectoire d'une injection jusqu'à un effet sur le chemin décisionnel (ou blocage).

SourcesRéférences et recherche publique

MITRE ATLAS 2026.07AML.T0051.000 Direct
OWASP GenAIOWASP GenAI LLM01:2025 Prompt Injection
Recherche publiqueSources de recherche publiques : MITRE ATLAS 2026.07 (mapping technique vérifié), OWASP GenAI (OWASP), et le gabarit public risk-voicebot (aivansoul/risk-voicebot) qui définit les 20 checkpoints. Aucune donnée de registre client : fiche générique, sans cote ni verdict.
couche 10 · Prompt Injection Filtercouche 14 · LLM Interpretation

Lire les 20 couches de sécurité

MITRE ATLAS 2026.07 · OWASP GenAI · risk-voicebot