
Framework de detección de malware Android basado en imágenes que aborda la ofuscación y la deriva de concepto (concept drift). Incluye conjuntos de datos curados y código Python para entrenar modelos de aprendizaje automático.
Este código pertenece a "BIDO: Un Enfoque Unificado para Abordar los Desafíos de Ofuscación y Deriva de Conceptos en la Detección de Malware Basada en Imágenes".
Autor: Junhui Li1, Chengbin Feng2, Zhiwei Yang1, Qi Mo1 y Wei Wang1.
Institución1:Escuela de Software, Universidad de Yunnan, Kunming, Yunnan 650091 China. Institución2:Escuela de Sistemas de Información, Universidad de Nueva Gales del Sur, Sídney, NSW 2052 Australia.
Debido al gran tamaño de los conjuntos de datos, proporcionamos acceso público a través de almacenamiento en la nube e instrucciones de uso detalladas en este repositorio.
Los conjuntos de datos completos Data-Ideal y Data-Obfu están alojados en OneDrive:https://1drv.ms/f/c/90ae1e5185e3d1c1/IgDhovkur4wcSbDRiadcg66nAVDRM9BNRXRN5ftU2kKnIcY?e=skQjJD
Este repositorio proporciona instrucciones detalladas sobre la estructura del conjunto de datos, el preprocesamiento y el uso en las secciones siguientes.
Este proyecto utiliza dos conjuntos de datos de malware de Android diseñados para evaluar tanto las condiciones de aprendizaje ideales como la robustez bajo ofuscación.
El conjunto de datos contiene un total de 24,830 aplicaciones de Android, incluyendo 12,375 muestras maliciosas y 12,455 muestras benignas.
Las etiquetas se asignan según los resultados de los análisis de VirusTotal. Una aplicación se etiqueta como benigna si recibe cero detecciones, y como maliciosa si es marcada por más de cuatro motores antivirus.
Los archivos APK se recopilan de múltiples fuentes ampliamente utilizadas y autorizadas, incluyendo Google Play, AndroZoo y el conjunto de datos de referencia CICMalDroid2020.
Este conjunto de datos se deriva del conjunto de datos Data-Ideal mediante la aplicación secuencial de seis técnicas de ofuscación a cada aplicación utilizando la herramienta Obfuscapk.
Las técnicas aplicadas incluyen Renombrado de Clases y Métodos, Cifrado de Cadenas de Recursos, Ofuscación de Flujo de Control, Nueva Alineación, Nueva Firma e Inserción de Código Basura.
Después de eliminar las aplicaciones que encontraron errores durante el proceso de ofuscación, el conjunto de datos final consta de 12,088 muestras maliciosas y 11,044 muestras benignas.