涵盖进攻性 AI(Offensive AI)的精选实用资源列表。
一份精选的涵盖进攻性 AI 的实用资源列表。
利用 AI 模型的漏洞。
对抗性机器学习负责评估其弱点并提供对策。
它可分为四种类型的攻击:提取、逆向、投毒和逃逸。

它试图通过发出能够最大化信息提取的请求来窃取模型的参数和超参数。

根据对手对模型的了解程度,可以实施白盒攻击和黑盒攻击。
在最简单的白盒场景中(当对手完全了解模型时,例如 sigmoid 函数),可以构建一个易于求解的线性方程组。
在一般场景中,当对模型的了解不足时,会使用替代模型。该模型利用向原始模型发出的请求进行训练,以模仿原始模型的功能。

训练替代模型(在许多情况下)相当于从头训练一个模型。
计算成本极高。
对手在检测到之前可发起的请求数量受到限制。
它们旨在逆转机器学习模型的信息流。
它们使对手能够了解那些本不应被明确共享的模型信息。
它们使我们能够获知训练数据或以统计属性形式呈现的模型信息。
可能存在三种类型:
成员推断攻击(MIA):对手试图判断某个样本是否被用作训练数据的一部分。
属性推断攻击(PIA):对手旨在提取在训练阶段未被显式编码为特征的统计属性。
重建:对手试图从训练集中重建一个或多个样本和/或其对应的标签。也被称为逆向。
它们旨在通过破坏训练集来使机器学习模型降低其准确性。
当这种攻击作用于训练数据时很难被检测到,因为攻击可以在使用相同训练数据的不同模型之间传播。
对手试图通过修改决策边界来破坏模型的可用性,从而产生错误的预测,或者在模型中创建后门。在后一种情况下,模型在大多数情况下表现正常(返回期望的预测),但对手特意构造的某些输入会产生非预期结果。对手可以操纵预测结果并发起后续攻击。
BadNets 是机器学习模型中最简单的后门类型。此外,BadNets 即使在与原始模型不同的任务上再次进行训练(迁移学习),也能在模型中保留下来。
需要特别注意的是,公开的预训练模型可能包含后门。
检测被投毒的数据,并使用数据清洗。
鲁棒训练方法。