
Курируемый список полезных ресурсов, охватывающих Offensive AI.
Курируемый список полезных ресурсов, посвящённых атакующему ИИ.
Эксплуатация уязвимостей моделей ИИ.
Состязательное машинное обучение отвечает за оценку их слабостей и предоставление контрмер.
Оно организуется в четыре типа атак: извлечение, инверсия, отравление и уклонение.

Оно пытается похитить параметры и гиперпараметры модели, отправляя запросы, которые максимизируют извлечение информации.

В зависимости от знания модели противником могут выполняться атаки «белого ящика» и «черного ящика».
В простейшем случае «белого ящика» (когда противник полностью знает модель, например, сигмоидальную функцию) можно создать систему линейных уравнений, которая легко решается.
В общем случае, когда знаний о модели недостаточно, используется суррогатная модель. Эта модель обучается на запросах, отправляемых исходной модели, чтобы имитировать ту же функциональность, что и оригинал.

Обучение суррогатной модели эквивалентно (во многих случаях) обучению модели с нуля.
Требует очень больших вычислительных мощностей.
Противник ограничен в количестве запросов, прежде чем будет обнаружен.
Округление выходных значений.
Использование дифференциальной конфиденциальности.
Использование ансамблей.
Использование специализированных защит
Они предназначены для обращения вспять потока информации модели машинного обучения.

Они позволяют противнику узнать модель, которая не была явно предназначена для раскрытия.
Они позволяют узнать обучающие данные или информацию в виде статистических свойств модели.
Возможны три типа:
Атака на членство в наборе данных (MIA): Противник пытается определить, использовался ли образец в процессе обучения.
Атака на вывод свойств (PIA): Противник стремится извлечь статистические свойства, которые не были явно закодированы как признаки на этапе обучения.
Реконструкция: Противник пытается восстановить один или несколько образцов из обучающего набора и/или их соответствующие метки. Также называется инверсией.