
Ein Machine-Learning-Toolkit zur Anomalieerkennung in Logdaten [ISSRE'16]
Loglizer ist ein auf maschinellem Lernen basierendes Toolkit zur Loganalyse für die automatisierte Anomalieerkennung.
Loglizer ist ein auf KI basierendes Tool zur Analyse großer Logdaten, das für die automatische Anomalieerkennung, intelligente Fehlerdiagnose und ähnliche Szenarien verwendet werden kann.
Logs sind im Entwicklungs- und Wartungsprozess vieler Softwaresysteme unerlässlich. Sie zeichnen während des Systembetriebs detaillierte Laufzeitinformationen auf, die es Entwicklern und Support-Ingenieuren ermöglichen, ihre Systeme zu überwachen sowie abnormales Verhalten und Fehler zu verfolgen. Loglizer bietet ein Toolkit, das eine Reihe von auf maschinellem Lernen basierenden Loganalysetechniken für die automatisierte Anomalieerkennung implementiert.
🔭 Wenn Sie Loglizer in Ihrer Forschung für eine Veröffentlichung verwenden, zitieren Sie bitte die folgende Arbeit.

Das Rahmenwerk zur Loganalyse für die Anomalieerkennung umfasst in der Regel die folgenden Komponenten:
Derzeit verfügbare Anomalieerkennungsmodelle:
Wir haben eine Reihe beschrifteter Logdatensätze in loghub für Forschungszwecke gesammelt. Wenn Sie an den Datensätzen interessiert sind, folgen Sie bitte dem Link, um Ihre Zugriffsanfrage zu stellen.
git clone https://github.com/logpai/loglizer.git
cd loglizer
pip install -r requirements.txt
# Load HDFS dataset. If you would like to try your own log, you need to rewrite the load function.
(x_train, y_train), (x_test, y_test) = dataloader.load_HDFS(...)
# Feature extraction and transformation
feature_extractor = preprocessing.FeatureExtractor()
feature_extractor.fit_transform(...)
# Model training
model = PCA()
model.fit(...)
# Feature transform after fitting
x_test = feature_extractor.transform(...)
# Model evaluation with labeled data
model.evaluate(...)
# Anomaly prediction
x_test = feature_extractor.transform(...)
model.predict(...) # predict anomalies on given data
Weitere Details finden Sie in der Demo in der Doku, um loszulegen. Bitte beachten Sie, dass alle ML-Modelle keine Zauberei sind: Sie müssen herausfinden, wie Sie die Parameter abstimmen, damit sie mit Ihren eigenen Daten funktionieren.
Wenn Sie die folgenden Ergebnisse reproduzieren möchten, führen Sie bitte benchmarks/HDFS_bechmark.py auf dem vollständigen HDFS-Datensatz aus (HDFS100k dient nur der Demo).
Bei Fragen oder Feedback posten Sie bitte auf der Issue-Seite.
| Modell | Paper-Referenz |
|---|
| Überwachte Modelle | |
| LR | [EuroSys'10] Fingerprinting the Datacenter: Automated Classification of Performance Crises, von Peter Bodík, Moises Goldszmidt, Armando Fox, Hans Andersen. [Microsoft] |
| Decision Tree | [ICAC'04] Failure Diagnosis Using Decision Trees, von Mike Chen, Alice X. Zheng, Jim Lloyd, Michael I. Jordan, Eric Brewer. [eBay] |
| SVM | [ICDM'07] Failure Prediction in IBM BlueGene/L Event Logs, von Yinglung Liang, Yanyong Zhang, Hui Xiong, Ramendra Sahoo. [IBM] |
| Unüberwachte Modelle | |
| LOF | [SIGMOD'00] LOF: Identifying Density-Based Local Outliers, von Markus M. Breunig, Hans-Peter Kriegel, Raymond T. Ng, Jörg Sander. |
| One-Class SVM | [Neural Computation'01] Estimating the Support of a High-Dimensional Distribution, von John Platt, Bernhard Schölkopf, John Shawe-Taylor, Alex J. Smola, Robert C. Williamson. |
| Isolation Forest | [ICDM'08] Isolation Forest, von Fei Tony Liu, Kai Ming Ting, Zhi-Hua Zhou. |
| PCA | [SOSP'09] Large-Scale System Problems Detection by Mining Console Logs, von Wei Xu, Ling Huang, Armando Fox, David Patterson, Michael I. Jordan. [Intel] |
| Invariants Mining | [ATC'10] Mining Invariants from Console Logs for System Problem Detection, von Jian-Guang Lou, Qiang Fu, Shengqi Yang, Ye Xu, Jiang Li. [Microsoft] |
| Clustering | [ICSE'16] Log Clustering based Problem Identification for Online Service Systems, von Qingwei Lin, Hongyu Zhang, Jian-Guang Lou, Yu Zhang, Xuewei Chen. [Microsoft] |
| DeepLog (folgt) | [CCS'17] DeepLog: Anomaly Detection and Diagnosis from System Logs through Deep Learning, von Min Du, Feifei Li, Guineng Zheng, Vivek Srikumar. |
| AutoEncoder (folgt) | [Arxiv'18] Anomaly Detection using Autoencoders in High Performance Computing Systems, von Andrea Borghesi, Andrea Bartolini, Michele Lombardi, Michela Milano, Luca Benini. |
| HDFS |
|---|
| Modell | Precision | Recall | F1 |
| LR | 0.955 | 0.911 | 0.933 |
| Decision Tree | 0.998 | 0.998 | 0.998 |
| SVM | 0.959 | 0.970 | 0.965 |
| LOF | 0.967 | 0.561 | 0.710 |
| One-Class SVM | 0.995 | 0.222 | 0.363 |
| Isolation Forest | 0.830 | 0.776 | 0.802 |
| PCA | 0.975 | 0.635 | 0.769 |
| Invariants Mining | 0.888 | 0.945 | 0.915 |
| Clustering | 1.000 | 0.720 | 0.837 |