Banana Navy
Catalogue EN
Lab · Threat modeling IA · Fiche détaillée

Évasion des détecteurs

tromper le détecteur IA qui devrait repérer la voix synthétique ou clonée, au lieu de fabriquer la voix.

FicheF24
CatégorieT-TB7-01 (tampering du signal)
Couches6 · Deepfake Detection, 8 · Speaker Verification
Systèmevoicebot IA

ne jamais valider un chemin critique sur un seul détecteur ni sur une confiance sans marge.

La menace

audio adverse calibré contre l'anti-spoofing (AASIST, RawNet2, WavLM) pour faire passer un contenu synthétique ou cloné pour authentique : perturbation calculée sur les gradients du détecteur, manipulation du gradient de confiance (déterminer et déplacer le seuil entre confiance haute et basse), transferabilité des perturbations d'une architecture à l'autre (l'exemple adverse conçu sur un modèle échoue rarement seul face à un ensemble hétérogène, mais transfère entre modèles proches).

Angle mortPourquoi les grilles classiques la ratent

les grilles traitent le détecteur comme une barrière fiable ("on a un anti-spoofing") ; or un contrôle IA est lui-même une fonction attaquable (gradients, sur-confiance, probabilité de sortie manipulable) et peut être transféré par l'attaquant. Aucun détecteur seul, aucune confiance seule, ne garantissent la détection.

MitigationSolution proposée

ne jamais valider un chemin critique sur un seul détecteur ni sur une confiance nue : ensemble hétérogène de détecteurs (architectures variées), seuils de confiance avec marge et escalade humaine de part et d'autre du seuil, validation/normalisation d'entrée (codec, ré-échantillonnage, filtrage) pour casser les perturbations, benchmarks de robustesse adverse (transferabilité) réévalués, alerte sur les échantillons proches du seuil.

Le contrôle proposé
aucun chemin critique validé sur un seul détecteur ni sur une confiance sans marge.

Preuve attendue
un exemple adverse (y compris transféré) ne fait pas basculer le verdict sous le seuil d'action à travers l'ensemble, ou fait basculer vers l'escalade humaine.

SourcesRéférences et recherche publique

MITRE ATLAS 2026.07AML.T0015 Evade AI Model · AML.T0043.000 White-Box Optimization (gradient de confiance) · AML.T0043.002 Black-Box Transfer (transferabilité)
OWASP GenAIpas de libellé OWASP direct : menace couverte par le mappage ATLAS ci-dessus.
Recherche publiqueArchitectures ciblées : AASIST (arXiv 2110.01200), RawNet2 (arXiv 2011.01108), back-ends WavLM (arXiv 2409.05032). Attaques adverses sur contre-mesures ASV : arXiv 1910.08716, arXiv 2501.11902, arXiv 2509.07132. Défense : arXiv 2003.03065.
couche 6 · Deepfake Detectioncouche 8 · Speaker Verification

Lire les 20 couches de sécurité

MITRE ATLAS 2026.07 · OWASP GenAI · risk-voicebot