
이미지 기반 안드로이드 악성코드 탐지 프레임워크로, 난독화 및 개념 변화를 처리합니다. 엄선된 데이터셋과 머신러닝 모델 학습을 위한 파이썬 코드를 포함합니다.
이 코드는 "BIDO: 이미지 기반 악성코드 탐지에서 주소 난독화 및 개념 변화 문제를 해결하기 위한 통합 접근 방식"에 속합니다.
저자: Junhui Li1, Chengbin Feng2, Zhiwei Yang1, Qi Mo1, Wei Wang1.
소속1:Yunnan University 소프트웨어 스쿨, Kunming, Yunnan 650091 중국. 소속2:University of New South Wales 정보시스템 스쿨, Sydney, NSW 2052 호주.
데이터셋의 크기가 크기 때문에, 클라우드 스토리지를 통한 공개 접근과 이 저장소의 상세 사용 지침을 제공합니다.
Data-Ideal 및 Data-Obfu 전체 데이터셋은 OneDrive에 호스팅되어 있습니다: https://1drv.ms/f/c/90ae1e5185e3d1c1/IgDhovkur4wcSbDRiadcg66nAVDRM9BNRXRN5ftU2kKnIcY?e=skQjJD
이 저장소는 아래 섹션에서 데이터셋 구조, 전처리 및 사용에 대한 상세 지침을 제공합니다.
이 프로젝트는 이상적인 학습 조건과 난독화 하에서의 견고성을 평가하기 위해 설계된 두 개의 Android 악성코드 데이터셋을 사용합니다.
데이터셋은 총 24,830개의 Android 애플리케이션을 포함하며, 12,375개의 악성 샘플과 12,455개의 정상 샘플로 구성됩니다.
레이블은 VirusTotal 스캔 결과에 따라 할당됩니다. 애플리케이션은 탐지 횟수가 0이면 정상으로, 4개 이상의 안티바이러스 엔진에 의해 플래그되면 악성으로 레이블링됩니다.
APK 파일은 Google Play, AndroZoo, CICMalDroid2020 벤치마크 데이터셋을 포함한 여러 널리 사용되고 권위 있는 소스에서 수집됩니다.
이 데이터셋은 Obfuscapk 도구를 사용하여 각 애플리케이션에 여섯 가지 난독화 기법을 순차적으로 적용하여 Data-Ideal 데이터셋에서 파생되었습니다.
적용된 기법에는 클래스 및 메서드 이름 바꾸기, 리소스 문자열 암호화, 제어 흐름 난독화, 새로운 정렬, 새로운 서명, 정크 코드 삽입이 포함됩니다.
난독화 과정에서 오류가 발생한 애플리케이션을 제거한 후, 최종 데이터셋은 12,088개의 악성 샘플과 11,044개의 정상 샘플로 구성됩니다.