
Offensive AI를 다루는 유용한 리소스의 선별된 목록
공격적 AI를 다루는 유용한 리소스 모음입니다.
AI 모델의 취약점을 악용합니다.
적대적 머신러닝은 AI 모델의 약점을 평가하고 대응책을 제공하는 역할을 담당합니다.
추출, 역전, 중독, 회피의 네 가지 공격 유형으로 구성됩니다.

정보 추출을 극대화하는 요청을 보내 모델의 파라미터와 하이퍼파라미터를 탈취하려고 시도합니다.

공격자가 모델에 대해 알고 있는 정도에 따라 화이트박스(white-box) 공격과 블랙박스(black-box) 공격을 수행할 수 있습니다.
가장 단순한 화이트박스 사례(공격자가 모델, 예: 시그모이드 함수에 대해 완전한 지식을 가진 경우)에서는 쉽게 풀 수 있는 선형 방정식 시스템을 만들 수 있습니다.
모델에 대한 지식이 충분하지 않은 일반적인 경우에는 대체 모델(substitute model)을 사용합니다. 이 모델은 원본 모델과 동일한 기능을 모방하기 위해 원본 모델에 보낸 요청으로 학습됩니다.

대체 모델을 학습하는 것은 (많은 경우) 처음부터 모델을 학습하는 것과 동일합니다.
계산 비용이 매우 많이 듭니다.
공격자는 탐지되기 전까지 사용할 수 있는 요청 수에 제한이 있습니다.
머신러닝 모델의 정보 흐름을 역으로 추적하기 위해 고안되었습니다.

공격자가 명시적으로 공유하려 하지 않았던 모델 정보를 알 수 있게 해줍니다.
학습 데이터나 모델의 통계적 속성과 같은 정보를 알 수 있게 해줍니다.
가능한 유형은 세 가지입니다:
멤버십 추론 공격(MIA): 공격자가 특정 샘플이 학습에 사용되었는지 여부를 판별하려고 시도합니다.
속성 추론 공격(PIA): 공격자가 학습 단계에서 특징으로 명시적으로 인코딩되지 않은 통계적 속성을 추출하는 것을 목표로 합니다.
재구성: 공격자가 학습 세트의 하나 이상의 샘플 및/또는 해당 레이블을 재구성하려고 시도합니다. 역전(inversion)이라고도 합니다.
고급 암호화 사용. 차등 프라이버시, 동형 암호화, 안전한 다자간 계산 등의 대응책이 있습니다.
과잉 학습과 프라이버시 사이의 관계 때문에 드롭아웃(Dropout)과 같은 정규화 기법을 사용합니다.
모델 압축은 재구성 공격에 대한 방어 수단으로 제안되었습니다.