
Una lista curata di risorse utili che coprono l'AI Offensiva.
Una lista curata di risorse utili che coprono l'Offensive AI.
Sfruttare le vulnerabilità dei modelli di IA.
L'Adversarial Machine Learning si occupa di valutare le loro debolezze e fornire contromisure.
È organizzato in quattro tipi di attacchi: estrazione, inversione, poisoning ed evasione.

Tenta di rubare i parametri e gli iperparametri di un modello effettuando richieste che massimizzano l'estrazione di informazioni.

A seconda della conoscenza del modello da parte dell'avversario, è possibile eseguire attacchi white-box e black-box.
Nel caso white-box più semplice (quando l'avversario ha piena conoscenza del modello, ad esempio una funzione sigmoide), si può creare un sistema di equazioni lineari facilmente risolvibile.
Nel caso generico, in cui la conoscenza del modello è insufficiente, si utilizza il modello sostitutivo. Questo modello viene addestrato con le richieste effettuate al modello originale al fine di imitarne le stesse funzionalità.

Addestrare un modello sostitutivo equivale (in molti casi) ad addestrare un modello da zero.
Molto intensivo dal punto di vista computazionale.
L'avversario ha limitazioni sul numero di richieste prima di essere rilevato.
Arrotondamento dei valori di output.
Uso della privacy differenziale.
Uso di ensemble.
Uso di difese specifiche
Sono finalizzati a invertire il flusso informativo di un modello di machine learning.

Consentono a un avversario di conoscere il modello che non era esplicitamente destinato a essere condiviso.
Ci permettono di conoscere i dati di addestramento o informazioni come proprietà statistiche del modello.
Sono possibili tre tipi:
Membership Inference Attack (MIA): un avversario tenta di determinare se un campione è stato impiegato come parte dell'addestramento.
Property Inference Attack (PIA): un avversario mira a estrarre proprietà statistiche che non erano state esplicitamente codificate come feature durante la fase di addestramento.
Reconstruction: un avversario cerca di ricostruire uno o più campioni dal set di addestramento e/o le relative etichette. Chiamato anche inversione.