
يوضح هذا المستودع خط أنابيب تعلم آلي لكشف تقنيات MITRE ATT&CK من السجلات وإثراء المخرجات باستخدام LLM محلي.
يستعرض هذا المستودع خط أنابيب تعلم آلي لكشف تقنيات MITRE ATT&CK من السجلات وإثراء المخرجات باستخدام نموذج لغوي كبير محلي (LLM).
ينقسم المشروع إلى مكوّنين رئيسيين:
يتم تدريب نموذج التعلم الآلي للتنبؤ بـ تقنية MITRE (أو BENIGN) من أحداث السجلات.
وهذا يتيح أتمتة كشف وتصنيف السلوك الضار المحتمل.
commandline من السجلاتmitre_label (مثل: T1059.001، T1105، BENIGN)python scripts/train_mitre_model.py
يقوم هذا السكربت بـ:
تحميل مجموعة البيانات dataset_full_160k.csv
تقسيم البيانات إلى مجموعات تدريب/اختبار
تحويل أسطر الأوامر إلى متجهات TF-IDF
تدريب نموذج الغابة العشوائية (Random Forest)
تقييم الأداء (الدقة، الاستدعاء، درجة F1، مصفوفة الالتباس)
حفظ النموذج المدرَّب والمتجه:
models/mitre_ml_model.pkl
models/tfidf_vectorizer.pkl

بمجرد أن يتنبأ نموذج التعلم الآلي بتقنية MITRE، يقوم LLM بإثراء النتيجة من خلال توفير:
شرح التقنية
سبب تطابق الأمر مع التقنية
نية المهاجم
خطوات التحقيق الموصى بها
قواعد الكشف المقترحة
تسد هذه الخطوة الفجوة بين التنبؤ الخام للنموذج والرؤى القابلة للتنفيذ لمحلل SOC.
يتم استدعاء نموذج لغوي كبير محلي (مثل Phi-3 عبر Ollama) باستخدام مطالبة تحتوي على:
تنبؤ النموذج
سطر الأوامر الخام
python scripts/enrich_with_llm.py

pip3 install -r requirements.txt
المكتبات