
Uma lista selecionada de recursos úteis que cobrem IA Ofensiva.
Uma lista selecionada de recursos úteis que cobrem IA Ofensiva.
Explorando as vulnerabilidades de modelos de IA.
O Aprendizado de Máquina Adversarial é responsável por avaliar suas fraquezas e fornecer contramedidas.
Está organizado em quatro tipos de ataques: extração, inversão, envenenamento e evasão.

Tenta roubar os parâmetros e hiperparâmetros de um modelo fazendo solicitações que maximizam a extração de informações.

Dependendo do conhecimento do modelo do adversário, ataques white-box e black-box podem ser realizados.
No caso mais simples de white-box (quando o adversário tem conhecimento total do modelo, por exemplo, uma função sigmoide), pode-se criar um sistema de equações lineares que pode ser facilmente resolvido.
No caso genérico, onde há conhecimento insuficiente do modelo, o modelo substituto é utilizado. Esse modelo é treinado com as solicitações feitas ao modelo original para imitar a mesma funcionalidade do original.

Treinar um modelo substituto é equivalente (em muitos casos) a treinar um modelo do zero.
Muito intensivo computacionalmente.
O adversário tem limitações no número de solicitações antes de ser detectado.
Arredondamento dos valores de saída.
Uso de privacidade diferencial.
Uso de ensembles.
Uso de defesas específicas
Eles têm a intenção de reverter o fluxo de informações de um modelo de aprendizado de máquina.

Eles permitem que um adversário conheça o modelo que não foi explicitamente planejado para ser compartilhado.
Eles nos permitem conhecer os dados de treinamento ou informações como propriedades estatísticas do modelo.
Três tipos são possíveis:
Ataque de Inferência de Associação (MIA): Um adversário tenta determinar se uma amostra foi empregada como parte do treinamento.
Ataque de Inferência de Propriedades (PIA): Um adversário tem como objetivo extrair propriedades estatísticas que não foram explicitamente codificadas como características durante a fase de treinamento.
Reconstrução: Um adversário tenta reconstruir uma ou mais amostras do conjunto de treinamento e/ou seus rótulos correspondentes. Também chamada de inversão.