cloisonner les instructions (séparation système ou utilisateur) et surtout tester si l'injection atteint réellement un workflow critique : si la sortie toxique est bloquée en aval, la menace est contrainte.
La menace
un utilisateur force le modèle à ignorer ses instructions en le lui demandant directement dans la conversation (« ignore previous instructions »).
Angle mortPourquoi les grilles classiques la ratent
elles ne modélisent pas une entrée « conversation » dont le contenu a autorité sur le comportement du moteur de traitement.
MitigationSolution proposée
cloisonner les instructions (séparation système ou utilisateur) et surtout tester si l'injection atteint réellement un workflow critique : si la sortie toxique est bloquée en aval, la menace est contrainte.
Le contrôle proposé
aucune sortie non filtrée n'atteint un workflow critique.
Preuve attendue
trajectoire d'une injection jusqu'à un effet sur le chemin décisionnel (ou blocage).