Loglizerは、自動異常検知のための機械学習ベースのログ分析ツールキットです。
LoglizerはAIベースのログビッグデータ分析ツールであり、自動異常検知やインテリジェントな障害診断などのシナリオに使用できます。
ログは、多くのソフトウェアシステムの開発・保守プロセスにおいて不可欠です。ログは、システム動作中の詳細な実行時情報を記録し、開発者やサポートエンジニアがシステムを監視し、異常な動作やエラーを追跡できるようにします。Loglizerは、自動異常検知のための機械学習ベースのログ分析技術を多数実装したツールキットを提供します。
🔭 研究や出版物でloglizerを使用する場合は、以下の論文を引用してください。

異常検知のためのログ分析フレームワークは、通常、以下のコンポーネントで構成されます。
現在利用可能な異常検知モデルは次のとおりです。
研究目的で、loghub にラベル付きログデータセットを収集しています。データセットに興味があれば、リンクに従ってアクセスリクエストを送信してください。
git clone https://github.com/logpai/loglizer.git
cd loglizer
pip install -r requirements.txt
# Load HDFS dataset. If you would like to try your own log, you need to rewrite the load function.
(x_train, y_train), (x_test, y_test) = dataloader.load_HDFS(...)
# Feature extraction and transformation
feature_extractor = preprocessing.FeatureExtractor()
feature_extractor.fit_transform(...)
# Model training
model = PCA()
model.fit(...)
# Feature transform after fitting
x_test = feature_extractor.transform(...)
# Model evaluation with labeled data
model.evaluate(...)
# Anomaly prediction
x_test = feature_extractor.transform(...)
model.predict(...) # predict anomalies on given data
より詳細な情報については、docs内のデモを参照して始めてください。なお、すべてのMLモデルは魔法ではありません。独自のデータで機能させるには、パラメータの調整方法を理解する必要があります。
以下の結果を再現したい場合は、完全なHDFSデータセット(HDFS100kはデモ専用)で benchmarks/HDFS_bechmark.py を実行してください。
ご質問やフィードバックは、issueページ に投稿してください。
| モデル | 論文参照 |
|---|
| 教師ありモデル | |
| LR | [EuroSys'10] データセンターのフィンガープリンティング:パフォーマンス危機の自動分類、著者:Peter Bodík、Moises Goldszmidt、Armando Fox、Hans Andersen。 [Microsoft] |
| 決定木 | [ICAC'04] 決定木を用いた障害診断、著者:Mike Chen、Alice X. Zheng、Jim Lloyd、Michael I. Jordan、Eric Brewer。 [eBay] |
| SVM | [ICDM'07] IBM BlueGene/Lイベントログにおける故障予測、著者:Yinglung Liang、Yanyong Zhang、Hui Xiong、Ramendra Sahoo。 [IBM] |
| 教師なしモデル | |
| LOF | [SIGMOD'00] LOF:密度ベースの局所外れ値の特定, 著者:Markus M. Breunig、Hans-Peter Kriegel、Raymond T. Ng、Jörg Sander。 |
| One-Class SVM | [Neural Computation'01] 高次元分布のサポートの推定, 著者:John Platt、Bernhard Schölkopf、John Shawe-Taylor、Alex J. Smola、Robert C. Williamson。 |
| Isolation Forest | [ICDM'08] Isolation Forest、著者:Fei Tony Liu、Kai Ming Ting、Zhi-Hua Zhou。 |
| PCA | [SOSP'09] コンソールログのマイニングによる大規模システム問題の検出、著者:Wei Xu、Ling Huang、Armando Fox、David Patterson、Michael I. Jordan。 [Intel] |
| 不変量マイニング | [ATC'10] システム問題検出のためのコンソールログからの不変量マイニング、著者:Jian-Guang Lou、Qiang Fu、Shengqi Yang、Ye Xu、Jiang Li。 [Microsoft] |
| クラスタリング | [ICSE'16] オンラインサービスシステムのためのログクラスタリングに基づく問題識別、著者:Qingwei Lin、Hongyu Zhang、Jian-Guang Lou、Yu Zhang、Xuewei Chen。 [Microsoft] |
| DeepLog(近日公開) | [CCS'17] DeepLog:ディープラーニングによるシステムログからの異常検知と診断、著者:Min Du、Feifei Li、Guineng Zheng、Vivek Srikumar。 |
| AutoEncoder(近日公開) | [Arxiv'18] 高性能コンピューティングシステムにおけるオートエンコーダを用いた異常検知、著者:Andrea Borghesi、Andrea Bartolini、Michele Lombardi、Michela Milano、Luca Benini。 |
| HDFS |
|---|
| モデル | 適合率 | 再現率 | F1 |
| LR | 0.955 | 0.911 | 0.933 |
| 決定木 | 0.998 | 0.998 | 0.998 |
| SVM | 0.959 | 0.970 | 0.965 |
| LOF | 0.967 | 0.561 | 0.710 |
| One-Class SVM | 0.995 | 0.222 | 0.363 |
| Isolation Forest | 0.830 | 0.776 | 0.802 |
| PCA | 0.975 | 0.635 | 0.769 |
| 不変量マイニング | 0.888 | 0.945 | 0.915 |
| クラスタリング | 1.000 | 0.720 | 0.837 |