
Una lista seleccionada de recursos útiles que cubren IA Ofensiva.
Explotando las vulnerabilidades de los modelos de IA.
El Aprendizaje Automático Adversarial se encarga de evaluar sus debilidades y proporcionar contramedidas.
Se organiza en cuatro tipos de ataques: extracción, inversión, envenenamiento y evasión.

Intenta robar los parámetros e hiperparámetros de un modelo realizando solicitudes que maximizan la extracción de información.

Dependiendo del conocimiento del modelo por parte del adversario, se pueden realizar ataques de caja blanca y de caja negra.
En el caso más simple de caja blanca (cuando el adversario tiene conocimiento completo del modelo, por ejemplo, una función sigmoide), se puede crear un sistema de ecuaciones lineales que puede resolverse fácilmente.
En el caso genérico, donde hay conocimiento insuficiente del modelo, se utiliza el modelo sustituto. Este modelo se entrena con las solicitudes realizadas al modelo original para imitar la misma funcionalidad que el original.

Entrenar un modelo sustituto equivale (en muchos casos) a entrenar un modelo desde cero.
Muy costoso computacionalmente.
El adversario tiene limitaciones en el número de solicitudes antes de ser detectado.
Redondeo de los valores de salida.
Uso de privacidad diferencial.
Uso de conjuntos.
Uso de defensas específicas
Están diseñados para invertir el flujo de información de un modelo de aprendizaje automático.

Permiten a un adversario conocer el modelo que no estaba explícitamente destinado a compartirse.
Permiten conocer los datos de entrenamiento o la información como propiedades estadísticas del modelo.
Son posibles tres tipos:
Ataque de inferencia de membresía (MIA): Un adversario intenta determinar si una muestra se empleó como parte del entrenamiento.
Ataque de inferencia de propiedades (PIA): Un adversario busca extraer propiedades estadísticas que no fueron codificadas explícitamente como características durante la fase de entrenamiento.