
Eine kuratierte Liste nützlicher Ressourcen, die Offensive AI abdecken.
Eine kuratierte Liste nützlicher Ressourcen, die Offensive AI abdecken.
Ausnutzung der Schwachstellen von KI-Modellen.
Adversarial Machine Learning ist dafür verantwortlich, ihre Schwächen zu bewerten und Gegenmaßnahmen bereitzustellen.
Es wird in vier Arten von Angriffen unterteilt: Extraktion, Inversion, Poisoning und Evasion.

Es wird versucht, die Parameter und Hyperparameter eines Modells zu stehlen, indem Anfragen gestellt werden, die die Extraktion von Informationen maximieren.

Je nach Kenntnis des Modells des Angreifers können White-Box- und Black-Box-Angriffe durchgeführt werden.
Im einfachsten White-Box-Fall (wenn der Angreifer vollständige Kenntnis des Modells hat, z. B. einer Sigmoid-Funktion), kann man ein lineares Gleichungssystem erstellen, das leicht gelöst werden kann.
Im generischen Fall, in dem unzureichende Kenntnis des Modells besteht, wird das Ersatzmodell verwendet. Dieses Modell wird mit den an das Originalmodell gestellten Anfragen trainiert, um die gleiche Funktionalität wie das Original nachzuahmen.

Das Trainieren eines Ersatzmodells ist (in vielen Fällen) gleichbedeutend mit dem Trainieren eines Modells von Grund auf.
Sehr rechenintensiv.
Der Angreifer hat Einschränkungen hinsichtlich der Anzahl der Anfragen, bevor er entdeckt wird.
Rundung der Ausgabewerte.
Verwendung von Differential Privacy.
Verwendung von Ensembles.
Verwendung spezifischer Verteidigungen
Sie sollen den Informationsfluss eines Machine-Learning-Modells umkehren.

Sie ermöglichen es einem Angreifer, das Modell zu kennen, das nicht explizit zur Weitergabe vorgesehen war.
Sie ermöglichen es uns, die Trainingsdaten oder Informationen als statistische Eigenschaften des Modells zu kennen.
Drei Arten sind möglich:
Membership Inference Attack (MIA): Ein Angreifer versucht festzustellen, ob eine Stichprobe als Teil des Trainings verwendet wurde.
Property Inference Attack (PIA): Ein Angreifer zielt darauf ab, statistische Eigenschaften zu extrahieren, die während der Trainingsphase nicht explizit als Merkmale kodiert wurden.