
यह रिपॉजिटरी लॉग्स से MITRE ATT&CK तकनीकों का पता लगाने और स्थानीय LLM का उपयोग करके आउटपुट को समृद्ध करने के लिए एक मशीन लर्निंग पाइपलाइन प्रदर्शित करती है।
यह रिपॉजिटरी लॉग से MITRE ATT&CK तकनीकों का पता लगाने और स्थानीय LLM का उपयोग करके आउटपुट को समृद्ध करने के लिए एक मशीन लर्निंग पाइपलाइन प्रदर्शित करती है।
यह परियोजना दो मुख्य घटकों में विभाजित है:
ML मॉडल को लॉग घटनाओं से MITRE तकनीक (या BENIGN) की भविष्यवाणी करने के लिए प्रशिक्षित किया गया है।
यह संभावित रूप से दुर्भावनापूर्ण व्यवहार का पता लगाने और वर्गीकरण को स्वचालित करने की अनुमति देता है।
commandline फ़ील्डmitre_label (जैसे, T1059.001, T1105, BENIGN)python scripts/train_mitre_model.py
यह स्क्रिप्ट:
dataset_full_160k.csv डेटासेट लोड करती है
डेटा को प्रशिक्षण/परीक्षण सेट में विभाजित करती है
कमांड लाइनों को TF-IDF वैक्टर में परिवर्तित करती है
Random Forest मॉडल को प्रशिक्षित करती है
प्रदर्शन का मूल्यांकन करती है (सटीकता, पुनर्प्राप्ति, F1-स्कोर, भ्रम मैट्रिक्स)
प्रशिक्षित मॉडल और वेक्टराइज़र को सहेजती है:
models/mitre_ml_model.pkl
models/tfidf_vectorizer.pkl

एक बार जब ML मॉडल किसी MITRE तकनीक की भविष्यवाणी करता है, तो LLM परिणाम को प्रदान करके समृद्ध करता है:
तकनीक स्पष्टीकरण
कमांड तकनीक से क्यों मेल खाता है
हमलावर का इरादा
अनुशंसित जांच कदम
सुझाए गए पहचान नियम
यह कदम कच्ची ML भविष्यवाणी और SOC विश्लेषक की कार्यान्वयन योग्य अंतर्दृष्टियों के बीच सेतु का काम करता है।
स्थानीय LLM (जैसे, Ollama के माध्यम से Phi-3) को एक प्रॉम्प्ट के साथ कॉल किया जाता है जिसमें शामिल है:
ML भविष्यवाणी
कच्ची कमांड लाइन
python scripts/enrich_with_llm.py

pip3 install -r requirements.txt
लाइब्रेरी