
كشف الشذوذ القائم على الترميز الذاتي لتحديد نطاقات التصيد باستخدام بيانات قائمة تحذيرات CERT Polska، مع دفاتر ملاحظات Jupyter للبحث والتعليم.
المستودع المرافق للمقالة "صراع الطبقات". يوضح هذا المستودع استخدام autoencoder للكشف عن النطاقات المشابهة لمجموعة (فرعية) معروفة من نطاقات التصيد التي نشرها CERT Polska.
يستخدم هذا المشروع بيانات من قائمة تحذير CERT Polska https://cert.pl/en/warning-list/ التي يديرها CERT Polska (NASK).
تُستخدم البيانات فقط لأغراض البحث والتعليم لا يتم إعادة توزيع القائمة الخام للنطاقات في هذا المستودع.
يستخدم هذا المشروع بيانات من مجموعة بيانات Majestic Million التي يديرها Majestic
يتم توفير مجموعة البيانات بموجب ترخيص Creative Commons Attribution 3.0 (CC BY 3.0)
تُستخدم البيانات فقط لأغراض البحث والتعليم لا يتم إعادة توزيع مجموعة البيانات الخام في هذا المستودع.
notebooks/0_fetch_data.ipynb - تنزيل بيانات المصدرnotebooks/1_eda.ipynb - تحليل البيانات الاستكشافي (EDA) لبيانات قائمة تحذير CERT.PLnotebooks/2_eda_based_data_selection.ipynb- اختيار مجموعة التدريب بناءً على تحليل EDAnotebooks/3_autoencoder_train_eval_inference.ipynb - بناء وتدريب واستدلال الـ autoencodernotebooks/xor_nn_decission_boundary.ipynb - سكريبت توضيحي مساعدdocker compose up --build
http://127.0.0.1:8888/tree وقم بتشغيل الدفاتر المرقمة بالترتيب: 0_fetch... و1_eda... و2_eda_based... و3_autoencoder....cd ./article
pdflatex class_struggle.tex