
Détection d'anomalies basée sur autoencodeur pour identifier les domaines de phishing à l'aide des données de la liste d'avertissement de CERT Polska, avec des notebooks Jupyter pour la recherche et l'éducation.
Dépôt accompagnant l'article "Class Struggle". Ce dépôt démontre l'utilisation d'un autoencodeur pour détecter des domaines similaires à un (sous-)ensemble connu de domaines de phishing publiés par CERT Polska.
Ce projet utilise les données de la CERT Polska Warning List https://cert.pl/en/warning-list/ maintenue par CERT Polska (NASK).
Les données sont utilisées uniquement à des fins de recherche et d'éducation. La liste brute des domaines n'est pas redistribuée dans ce dépôt.
Ce projet utilise les données du jeu de données Majestic Million maintenu par Majestic
Le jeu de données est fourni sous la licence Creative Commons Attribution 3.0 (CC BY 3.0)
Les données sont utilisées uniquement à des fins de recherche et d'éducation. Le jeu de données brut n'est pas redistribué dans ce dépôt.
notebooks/0_fetch_data.ipynb - téléchargement des données sourcesnotebooks/1_eda.ipynb - analyse exploratoire des données (EDA) des données de la liste d'avertissement de CERT.PLnotebooks/2_eda_based_data_selection.ipynb- sélection de l'ensemble d'entraînement basée sur l'EDAnotebooks/3_autoencoder_train_eval_inference.ipynb - construction, entraînement et inférence de l'autoencodeurnotebooks/xor_nn_decission_boundary.ipynb - script de démonstration auxiliairedocker compose up --build
http://127.0.0.1:8888/tree et exécuter les notebooks numérotés dans l'ordre : 0_fetch..., 1_eda..., 2_eda_based..., 3_autoencoder....cd ./article
pdflatex class_struggle.tex