
CERT Polska चेतावनी सूची डेटा का उपयोग करके फ़िशिंग डोमेन की पहचान के लिए ऑटोएन्कोडर-आधारित विसंगति पहचान, अनुसंधान और शिक्षा के लिए Jupyter नोटबुक के साथ।
"Class Struggle" लेख के साथ संलग्न रिपॉजिटरी। यह रिपॉजिटरी CERT Polska द्वारा प्रकाशित फ़िशिंग डोमेन के ज्ञात (उप)समूह के समान डोमेन का पता लगाने के लिए ऑटोएन्कोडर के उपयोग को प्रदर्शित करती है।
यह परियोजना CERT Polska चेतावनी सूची https://cert.pl/en/warning-list/ से डेटा का उपयोग करती है, जिसे CERT Polska (NASK) द्वारा अनुरक्षित किया जाता है।
डेटा का उपयोग केवल अनुसंधान और शैक्षिक उद्देश्यों के लिए किया जाता है। डोमेन की कच्ची सूची इस रिपॉजिटरी में पुनर्वितरित नहीं की जाती है।
यह परियोजना Majestic द्वारा अनुरक्षित Majestic Million डेटासेट से डेटा का उपयोग करती है।
डेटासेट क्रिएटिव कॉमन्स एट्रिब्यूशन 3.0 लाइसेंस (CC BY 3.0) के तहत प्रदान किया गया है।
डेटा का उपयोग केवल अनुसंधान और शैक्षिक उद्देश्यों के लिए किया जाता है। कच्चा डेटासेट इस रिपॉजिटरी में पुनर्वितरित नहीं किया जाता है।
notebooks/0_fetch_data.ipynb - स्रोत डेटा डाउनलोड करनाnotebooks/1_eda.ipynb - CERT.PL चेतावनी सूची के डेटा का अन्वेषणात्मक डेटा विश्लेषण (EDA)notebooks/2_eda_based_data_selection.ipynb - EDA आधारित प्रशिक्षण सेट चयनnotebooks/3_autoencoder_train_eval_inference.ipynb - ऑटोएन्कोडर का निर्माण, प्रशिक्षण और अनुमानnotebooks/xor_nn_decission_boundary.ipynb - सहायक प्रदर्शन स्क्रिप्टdocker compose up --build
http://127.0.0.1:8888/tree और क्रमांकित नोटबुक को क्रम में चलाएँ: 0_fetch..., 1_eda..., 2_eda_based..., 3_autoencoder...।cd ./article
pdflatex class_struggle.tex