
Detecção de anomalias baseada em autoencoder para identificar domínios de phishing usando dados da lista de avisos do CERT Polska, com notebooks Jupyter para pesquisa e educação.
Repositório que acompanha o artigo "Luta de Classes". O repositório demonstra o uso de um autoencoder para detectar domínios semelhantes a um (sub)conjunto conhecido de domínios de phishing publicados pela CERT Polska.
Este projeto utiliza dados da Lista de Aviso da CERT Polska https://cert.pl/en/warning-list/ mantida pela CERT Polska (NASK).
Os dados são utilizados exclusivamente para fins de pesquisa e educacionais. A lista bruta de domínios não é redistribuída neste repositório.
Este projeto utiliza dados do conjunto de dados Majestic Million mantido pela Majestic
O conjunto de dados é fornecido sob a Licença Creative Commons Attribution 3.0 (CC BY 3.0)
Os dados são utilizados exclusivamente para fins de pesquisa e educacionais. O conjunto de dados bruto não é redistribuído neste repositório.
notebooks/0_fetch_data.ipynb - download dos dados de origemnotebooks/1_eda.ipynb - análise exploratória de dados (EDA) dos dados da lista de aviso da CERT.PLnotebooks/2_eda_based_data_selection.ipynb - seleção do conjunto de treino baseada em EDAnotebooks/3_autoencoder_train_eval_inference.ipynb - construção, treino e inferência do autoencodernotebooks/xor_nn_decission_boundary.ipynb - script auxiliar de demonstraçãodocker compose up --build
http://127.0.0.1:8888/tree e executar os notebooks numerados em ordem: 0_fetch..., 1_eda..., 2_eda_based..., 3_autoencoder....cd ./article
pdflatex class_struggle.tex