该仓库演示了一个机器学习流水线,用于从日志中检测 MITRE ATT&CK 技术,并使用本地 LLM 富化输出。
该项目分为两个主要组件:
ML 模型经过训练,可从日志事件中预测 MITRE 技术(或 BENIGN)。
这样可以自动化检测和分类潜在的恶意行为。
commandline 字段mitre_label(例如 T1059.001、T1105、BENIGN)python scripts/train_mitre_model.py
该脚本:
加载数据集 dataset_full_160k.csv
将数据拆分为训练集/测试集
将命令行转换为 TF-IDF 向量
训练随机森林模型
评估性能(精确率、召回率、F1 分数、混淆矩阵)
保存训练好的模型和向量化器:
models/mitre_ml_model.pkl
models/tfidf_vectorizer.pkl

一旦 ML 模型预测出 MITRE 技术,LLM 将提供以下内容来富化结果:
技术解释
命令为何与该技术匹配
攻击者意图
建议的调查步骤
建议的检测规则
此步骤弥合了原始 ML 预测与 SOC 分析师可操作见解之间的差距。
本地 LLM(例如通过 Ollama 运行的 Phi-3)会被调用,提示词包含:
ML 预测
原始命令行
python scripts/enrich_with_llm.py

pip3 install -r requirements.txt
依赖库