
Detección de anomalías basada en autoencoder para identificar dominios de phishing utilizando datos de la lista de advertencias de CERT Polska, con cuadernos Jupyter para investigación y educación.
Repositorio que acompaña al artículo "Class Struggle". El repositorio demuestra el uso de un autoencoder para detectar dominios similares a un (sub)conjunto conocido de dominios de phishing publicados por CERT Polska.
Este proyecto utiliza datos de la Lista de Advertencia de CERT Polska https://cert.pl/en/warning-list/ mantenida por CERT Polska (NASK).
Los datos se utilizan exclusivamente con fines de investigación y educativos La lista sin procesar de dominios no se redistribuye en este repositorio.
Este proyecto utiliza datos del conjunto de datos Majestic Million mantenido por Majestic
El conjunto de datos se proporciona bajo la Licencia Creative Commons Attribution 3.0 (CC BY 3.0)
Los datos se utilizan exclusivamente con fines de investigación y educativos El conjunto de datos sin procesar no se redistribuye en este repositorio.
notebooks/0_fetch_data.ipynb - descarga de datos fuentenotebooks/1_eda.ipynb - análisis exploratorio de datos (EDA) de los datos de la lista de advertencia de CERT.PLnotebooks/2_eda_based_data_selection.ipynb- selección del conjunto de entrenamiento basada en EDAnotebooks/3_autoencoder_train_eval_inference.ipynb - construcción, entrenamiento e inferencia del autoencodernotebooks/xor_nn_decission_boundary.ipynb - script de demostración auxiliardocker compose up --build
http://127.0.0.1:8888/tree y ejecutar los cuadernos numerados en orden: 0_fetch..., 1_eda..., 2_eda_based..., 3_autoencoder....cd ./article
pdflatex class_struggle.tex