Skip to content
KitploitKITPLOIT
OutilsBlog
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
loglizer — Une boîte à outils d'apprentissage automatique pour la détection d'anomalies basée sur les journaux [ISSRE'16] | Kitploit
Outils/GitHubGitHub/logpai/loglizer
Apprentissage AutomatiqueDétection d'AnomaliesAnalyse de Journaux
GitHublogpai/loglizer

loglizer

Une boîte à outils d'apprentissage automatique pour la détection d'anomalies basée sur les journaux [ISSRE'16]

Voir le dépôt
1.4k437il y a 2 ansVérifié par Kitploit

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Partager

loglizer

Loglizer est une boîte à outils d'analyse de journaux basée sur l'apprentissage automatique pour la détection automatisée d'anomalies.

Loglizer est un outil d'analyse de données massives de journaux basé sur l'IA, pouvant être utilisé pour la détection automatique d'anomalies, le diagnostic intelligent de pannes, etc.

Les journaux sont essentiels dans le processus de développement et de maintenance de nombreux systèmes logiciels. Ils enregistrent des informations détaillées sur l'exécution pendant le fonctionnement du système, ce qui permet aux développeurs et aux ingénieurs de support de surveiller leurs systèmes et de suivre les comportements anormaux et les erreurs. Loglizer fournit une boîte à outils qui implémente un certain nombre de techniques d'analyse de journaux basées sur l'apprentissage automatique pour la détection automatisée d'anomalies.

🔭 Si vous utilisez loglizer dans vos recherches pour une publication, veuillez citer l'article suivant.

  • Shilin He, Jieming Zhu, Pinjia He, Michael R. Lyu. Experience Report: System Log Analysis for Anomaly Detection, IEEE International Symposium on Software Reliability Engineering (ISSRE), 2016. [Bibtex][Version chinoise] (Article le plus influent de l'ISSRE)

Cadre

Cadre de détection d'anomalies

Le cadre d'analyse de journaux pour la détection d'anomalies comprend généralement les composants suivants :

  1. Collecte de journaux : Les journaux sont générés au moment de l'exécution et agrégés dans un endroit centralisé via un pipeline de streaming de données, tel que Flume et Kafka.
  2. Analyse syntaxique des journaux : L'objectif de l'analyse syntaxique des journaux est de convertir les messages de journal non structurés en une carte d'événements structurés, sur laquelle des modèles d'apprentissage automatique sophistiqués peuvent être appliqués. Les détails de l'analyse syntaxique des journaux se trouvent dans notre projet logparser.
  3. Extraction de caractéristiques : Les journaux structurés peuvent être découpés en courtes séquences de journaux via une fenêtre d'intervalle, une fenêtre glissante ou une fenêtre de session. Ensuite, l'extraction de caractéristiques est effectuée pour vectoriser chaque séquence de journaux, par exemple, en utilisant un vecteur de comptage d'événements.
  4. Détection d'anomalies : Des modèles de détection d'anomalies sont entraînés pour vérifier si un vecteur de caractéristiques donné est une anomalie ou non.

Modèles

Modèles de détection d'anomalies actuellement disponibles :

Données de journaux

Nous avons collecté un ensemble de jeux de données de journaux étiquetés dans loghub à des fins de recherche. Si vous êtes intéressé par les jeux de données, veuillez suivre le lien pour soumettre votre demande d'accès.

Installation

root@kitploit:~
git clone https://github.com/logpai/loglizer.git
cd loglizer
pip install -r requirements.txt

Utilisation de l'API

root@kitploit:~
# Load HDFS dataset. If you would like to try your own log, you need to rewrite the load function.
(x_train, y_train), (x_test, y_test) = dataloader.load_HDFS(...)

# Feature extraction and transformation
feature_extractor = preprocessing.FeatureExtractor()
feature_extractor.fit_transform(...) 

# Model training
model = PCA()
model.fit(...)

# Feature transform after fitting
x_test = feature_extractor.transform(...)
# Model evaluation with labeled data
model.evaluate(...)

# Anomaly prediction
x_test = feature_extractor.transform(...)
model.predict(...) # predict anomalies on given data

Pour plus de détails, veuillez suivre la démo dans les docs pour commencer. Veuillez noter que tous les modèles de ML ne sont pas magiques, vous devez comprendre comment régler les paramètres pour les faire fonctionner sur vos propres données.

Résultats de benchmarking

Si vous souhaitez reproduire les résultats suivants, veuillez exécuter benchmarks/HDFS_bechmark.py sur le jeu de données HDFS complet (HDFS100k est uniquement pour la démo).

Contributeurs

  • Shilin He, The Chinese University of Hong Kong
  • Jieming Zhu, The Chinese University of Hong Kong, actuellement à Huawei Noah's Ark Lab
  • Pinjia He, The Chinese University of Hong Kong, actuellement à l'ETH Zurich

Commentaires

Pour toute question ou commentaire, veuillez poster sur la page des issues.

Historique

  • 14 mai 2016 : commit initial
  • 21 septembre 2017 : mise à jour du code et du readme
  • 21 mars 2018 : réécriture de la plupart du code et ajout de commentaires détaillés
  • 18 février 2019 : restructuration du dépôt avec une démo pratique
Télécharger l’outil
ModèleRéférence de l'article
Supervised models
LR[EuroSys'10] Fingerprinting the Datacenter: Automated Classification of Performance Crises, par Peter Bodík, Moises Goldszmidt, Armando Fox, Hans Andersen. [Microsoft]
Decision Tree[ICAC'04] Failure Diagnosis Using Decision Trees, par Mike Chen, Alice X. Zheng, Jim Lloyd, Michael I. Jordan, Eric Brewer. [eBay]
SVM[ICDM'07] Failure Prediction in IBM BlueGene/L Event Logs, par Yinglung Liang, Yanyong Zhang, Hui Xiong, Ramendra Sahoo. [IBM]
Unsupervised models
LOF[SIGMOD'00] LOF: Identifying Density-Based Local Outliers, par Markus M. Breunig, Hans-Peter Kriegel, Raymond T. Ng, Jörg Sander.
One-Class SVM[Neural Computation'01] Estimating the Support of a High-Dimensional Distribution, par John Platt, Bernhard Schölkopf, John Shawe-Taylor, Alex J. Smola, Robert C. Williamson.
Isolation Forest[ICDM'08] Isolation Forest, par Fei Tony Liu, Kai Ming Ting, Zhi-Hua Zhou.
PCA[SOSP'09] Large-Scale System Problems Detection by Mining Console Logs, par Wei Xu, Ling Huang, Armando Fox, David Patterson, Michael I. Jordan. [Intel]
Invariants Mining[ATC'10] Mining Invariants from Console Logs for System Problem Detection, par Jian-Guang Lou, Qiang Fu, Shengqi Yang, Ye Xu, Jiang Li. [Microsoft]
Clustering[ICSE'16] Log Clustering based Problem Identification for Online Service Systems, par Qingwei Lin, Hongyu Zhang, Jian-Guang Lou, Yu Zhang, Xuewei Chen. [Microsoft]
DeepLog (à venir)[CCS'17] DeepLog: Anomaly Detection and Diagnosis from System Logs through Deep Learning, par Min Du, Feifei Li, Guineng Zheng, Vivek Srikumar.
AutoEncoder (à venir)[Arxiv'18] Anomaly Detection using Autoencoders in High Performance Computing Systems, par Andrea Borghesi, Andrea Bartolini, Michele Lombardi, Michela Milano, Luca Benini.
HDFS
ModèlePrécisionRappelF1
LR0.9550.9110.933
Decision Tree0.9980.9980.998
SVM0.9590.9700.965
LOF0.9670.5610.710
One-Class SVM0.9950.2220.363
Isolation Forest0.8300.7760.802
PCA0.9750.6350.769
Invariants Mining0.8880.9450.915
Clustering1.0000.7200.837