
Обнаружение аномалий на основе автоэнкодера для идентификации фишинговых доменов с использованием данных списка предупреждений CERT Polska, с блокнотами Jupyter для исследований и образования.
Репозиторий, сопровождающий статью "Классовая борьба". Репозиторий демонстрирует использование автоэнкодера для обнаружения доменов, похожих на известное (под)множество фишинговых доменов, опубликованное CERT Polska.
Этот проект использует данные из Списка предупреждений CERT Polska https://cert.pl/en/warning-list/, поддерживаемого CERT Polska (NASK).
Данные используются исключительно в исследовательских и образовательных целях Исходный список доменов не распространяется в этом репозитории.
Этот проект использует данные из набора данных Majestic Million, поддерживаемого Majestic
Набор данных предоставляется под лицензией Creative Commons Attribution 3.0 (CC BY 3.0)
Данные используются исключительно в исследовательских и образовательных целях Исходный набор данных не распространяется в этом репозитории.
notebooks/0_fetch_data.ipynb - загрузка исходных данныхnotebooks/1_eda.ipynb - исследовательский анализ данных (EDA) данных из списка предупреждений CERT.PLnotebooks/2_eda_based_data_selection.ipynb - выбор обучающего набора на основе EDAnotebooks/3_autoencoder_train_eval_inference.ipynb - построение, обучение и инференс автоэнкодераnotebooks/xor_nn_decission_boundary.ipynb - вспомогательный демонстрационный скриптdocker compose up --build
http://127.0.0.1:8888/tree и запустите пронумерованные блокноты по порядку: 0_fetch..., 1_eda..., 2_eda_based..., 3_autoencoder....cd ./article
pdflatex class_struggle.tex