
Rilevamento di anomalie basato su autoencoder per identificare domini di phishing utilizzando i dati della lista di avvisi di CERT Polska, con notebook Jupyter per ricerca e formazione.
Repository che accompagna l'articolo "Lotta di Classe". Il repository dimostra l'uso di un autoencoder per rilevare domini simili a un (sotto)insieme noto di domini di phishing pubblicati da CERT Polska.
Questo progetto utilizza dati della Lista di Avvertimento di CERT Polska https://cert.pl/en/warning-list/ mantenuta da CERT Polska (NASK).
I dati sono utilizzati esclusivamente per scopi di ricerca e didattici. La lista grezza dei domini non viene ridistribuita in questo repository.
Questo progetto utilizza dati dal dataset Majestic Million mantenuto da Majestic
Il dataset è fornito sotto la licenza Creative Commons Attribution 3.0 (CC BY 3.0)
I dati sono utilizzati esclusivamente per scopi di ricerca e didattici. Il dataset grezzo non viene ridistribuito in questo repository.
notebooks/0_fetch_data.ipynb - scaricamento dei dati sorgentenotebooks/1_eda.ipynb - analisi esplorativa dei dati (EDA) dei dati dalla lista di avvertimento CERT.PLnotebooks/2_eda_based_data_selection.ipynb - selezione del set di addestramento basata sull'EDAnotebooks/3_autoencoder_train_eval_inference.ipynb - costruzione, addestramento e inferenza dell'autoencodernotebooks/xor_nn_decission_boundary.ipynb - script dimostrativo ausiliariodocker compose up --build
http://127.0.0.1:8888/tree ed esegui i notebook numerati nell'ordine: 0_fetch..., 1_eda..., 2_eda_based..., 3_autoencoder....cd ./article
pdflatex class_struggle.tex