
Этот репозиторий демонстрирует конвейер машинного обучения для обнаружения техник MITRE ATT&CK в логах и обогащения выходных данных с помощью локальной LLM.
Этот репозиторий демонстрирует конвейер машинного обучения для обнаружения техник MITRE ATT&CK по логам и обогащения результатов с помощью локальной LLM.
Проект состоит из двух основных компонентов:
Модель ML обучена предсказывать технику MITRE (или BENIGN) по событиям логов.
Это позволяет автоматизировать обнаружение и категоризацию потенциально вредоносной активности.
commandline из логовmitre_label (например, T1059.001, T1105, BENIGN)python scripts/train_mitre_model.py
Этот скрипт:
Загружает набор данных dataset_full_160k.csv
Разделяет данные на обучающий и тестовый наборы
Преобразует командные строки в TF-IDF векторы
Обучает модель Random Forest
Оценивает эффективность (precision, recall, F1-score, матрица ошибок)
Сохраняет обученную модель и векторизатор:
models/mitre_ml_model.pkl
models/tfidf_vectorizer.pkl

Когда модель ML предсказывает технику MITRE, LLM обогащает результат, предоставляя:
Пояснение техники
Почему команда соответствует технике
Намерения атакующего
Рекомендуемые шаги расследования
Предлагаемые правила обнаружения
Этот шаг связывает «сырой» прогноз ML с практическими рекомендациями для аналитика SOC.
Локальная LLM (например, Phi-3 через Ollama) вызывается с подсказкой (prompt), содержащей:
Прогноз ML
Исходная командная строка
python scripts/enrich_with_llm.py

pip3 install -r requirements.txt
Библиотеки