
Une liste organisée de ressources utiles couvrant l'IA offensive.
Une liste organisée de ressources utiles couvrant l'IA offensive.
Exploiter les vulnérabilités des modèles d'IA.
L'apprentissage contradictoire est chargé d'évaluer leurs faiblesses et de fournir des contre-mesures.
Ce domaine se décline en quatre types d'attaques : l'extraction, l'inversion, l'empoisonnement et l'évasion.

Elle tente de voler les paramètres et hyperparamètres d'un modèle en effectuant des requêtes qui maximisent l'extraction d'informations.

Selon la connaissance qu'a l'adversaire du modèle, des attaques en boîte blanche et en boîte noire peuvent être menées.
Dans le cas le plus simple de la boîte blanche (lorsque l'adversaire a une connaissance complète du modèle, par exemple une fonction sigmoïde), on peut créer un système d'équations linéaires facilement résoluble.
Dans le cas générique, où la connaissance du modèle est insuffisante, on utilise le modèle substitut. Ce modèle est entraîné à partir des requêtes adressées au modèle original afin d'imiter la même fonctionnalité que celui-ci.

Entraîner un modèle substitut équivaut (dans de nombreux cas) à entraîner un modèle à partir de zéro.
Très coûteux en calcul.
L'adversaire est limité quant au nombre de requêtes avant d'être détecté.
Arrondi des valeurs de sortie.
Utilisation de la confidentialité différentielle.
Utilisation de méthodes d'ensemble.
Utilisation de défenses spécifiques
Elles visent à inverser le flux d'informations d'un modèle d'apprentissage automatique.

Elles permettent à un adversaire de connaître le modèle qui n'était pas explicitement destiné à être partagé.
Elles nous permettent de connaître les données d'entraînement ou des informations sous forme de propriétés statistiques du modèle.
Trois types sont possibles :