
Autoencoder-basierte Anomalieerkennung zur Identifizierung von Phishing-Domains anhand der CERT-Polska-Warnlistendaten, mit Jupyter-Notebooks für Forschung und Lehre.
Repository, das den Artikel "Class Struggle" begleitet. Das Repository demonstriert die Verwendung eines Autoencoders zur Erkennung von Domains, die einer bekannten (Teil-)Menge von Phishing-Domains ähneln, welche von CERT Polska veröffentlicht wurden.
Dieses Projekt verwendet Daten aus der CERT-Polska-Warnliste https://cert.pl/en/warning-list/, die von CERT Polska (NASK) gepflegt wird.
Die Daten werden ausschließlich für Forschungs- und Bildungszwecke verwendet. Die Rohliste der Domains wird in diesem Repository nicht weiterverteilt.
Dieses Projekt verwendet Daten aus dem Majestic-Million-Datensatz, der von Majestic gepflegt wird.
Der Datensatz wird unter der Creative Commons Attribution 3.0 License (CC BY 3.0) bereitgestellt.
Die Daten werden ausschließlich für Forschungs- und Bildungszwecke verwendet. Der Rohdatensatz wird in diesem Repository nicht weiterverteilt.
notebooks/0_fetch_data.ipynb - Herunterladen der Quelldatennotebooks/1_eda.ipynb - Explorative Datenanalyse (EDA) der Daten aus der CERT.PL-Warnlistenotebooks/2_eda_based_data_selection.ipynb- Auf EDA basierende Auswahl des Trainingssetsnotebooks/3_autoencoder_train_eval_inference.ipynb - Konstruktion, Training und Inferenz des Autoencodersnotebooks/xor_nn_decission_boundary.ipynb - Zusätzliches Demonstrationsskriptdocker compose up --build
http://127.0.0.1:8888/tree und führen Sie die nummerierten Notebooks in der Reihenfolge aus: 0_fetch..., 1_eda..., 2_eda_based..., 3_autoencoder....cd ./article
pdflatex class_struggle.tex