Skip to content
KitploitKITPLOIT
ИнструментыБлог
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
loglizer — Инструментарий машинного обучения для обнаружения аномалий на основе журналов [ISSRE'16] | Kitploit
Инструменты/GitHubGitHub/logpai/loglizer
Машинное ОбучениеОбнаружение АномалийАнализ Журналов
GitHublogpai/loglizer

loglizer

Инструментарий машинного обучения для обнаружения аномалий на основе журналов [ISSRE'16]

Репозиторий
1.4k4372 лет назадПроверено Kitploit

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться

loglizer

Loglizer — это инструментарий анализа журналов на основе машинного обучения для автоматического обнаружения аномалий.

Loglizer — это инструмент анализа больших данных журналов на основе ИИ, который можно использовать в таких сценариях, как автоматическое обнаружение аномалий, интеллектуальная диагностика неисправностей и т. д.

Журналы крайне важны в процессе разработки и сопровождения многих программных систем. Они записывают подробную информацию о времени выполнения во время работы системы, что позволяет разработчикам и инженерам поддержки контролировать свои системы и отслеживать аномальное поведение и ошибки. Loglizer предоставляет инструментарий, реализующий ряд методов анализа журналов на основе машинного обучения для автоматического обнаружения аномалий.

🔭 Если вы используете loglizer в своих исследованиях для публикации, пожалуйста, укажите следующую статью.

  • Shilin He, Jieming Zhu, Pinjia He, Michael R. Lyu. Experience Report: System Log Analysis for Anomaly Detection, IEEE International Symposium on Software Reliability Engineering (ISSRE), 2016. [Bibtex][китайская версия] (Самая влиятельная статья ISSRE)

Структура

Архитектура обнаружения аномалий

Структура анализа журналов для обнаружения аномалий обычно включает следующие компоненты:

  1. Сбор журналов: Журналы создаются во время выполнения и агрегируются в централизованное место с помощью конвейера потоковой передачи данных, например Flume и Kafka.
  2. Разбор журналов: Цель разбора журналов — преобразовать неструктурированные сообщения журналов в карту структурированных событий, на основе которой можно применять сложные модели машинного обучения. Подробности о разборе журналов можно найти в нашем проекте logparser.
  3. Извлечение признаков: Структурированные журналы можно разбивать на короткие последовательности журналов с помощью интервального окна, скользящего окна или окна сеанса. Затем выполняется извлечение признаков для векторизации каждой последовательности журналов, например, с использованием вектора подсчёта событий.
  4. Обнаружение аномалий: Модели обнаружения аномалий обучаются проверять, является ли данный вектор признаков аномалией или нет.

Модели

Модели обнаружения аномалий, доступные в настоящее время:

Данные журналов

Мы собрали ряд размеченных наборов данных журналов в loghub для исследовательских целей. Если вас интересуют эти наборы данных, перейдите по ссылке, чтобы отправить запрос на доступ.

Установка

root@kitploit:~
git clone https://github.com/logpai/loglizer.git
cd loglizer
pip install -r requirements.txt

Использование API

root@kitploit:~
# Load HDFS dataset. If you would like to try your own log, you need to rewrite the load function.
(x_train, y_train), (x_test, y_test) = dataloader.load_HDFS(...)

# Feature extraction and transformation
feature_extractor = preprocessing.FeatureExtractor()
feature_extractor.fit_transform(...) 

# Model training
model = PCA()
model.fit(...)

# Feature transform after fitting
x_test = feature_extractor.transform(...)
# Model evaluation with labeled data
model.evaluate(...)

# Anomaly prediction
x_test = feature_extractor.transform(...)
model.predict(...) # predict anomalies on given data

Чтобы начать работу, следуйте демонстрации в документации. Обратите внимание, что все модели машинного обучения — не магия: вам нужно разобраться, как настраивать параметры, чтобы они работали на ваших собственных данных.

Результаты сравнительного тестирования

Если вы хотите воспроизвести следующие результаты, запустите benchmarks/HDFS_bechmark.py на полном наборе данных HDFS (HDFS100k предназначен только для демонстрации).

Авторы

  • Shilin He, Китайский университет Гонконга
  • Jieming Zhu, Китайский университет Гонконга, в настоящее время в Huawei Noah's Ark Lab
  • Pinjia He, Китайский университет Гонконга, в настоящее время в ETH Zurich

Обратная связь

По любым вопросам или отзывам, пожалуйста, оставляйте их на странице issues.

История

  • 14 мая 2016: первоначальный коммит
  • 21 сентября 2017: обновление кода и readme
  • 21 марта 2018: переписана большая часть кода и добавлены подробные комментарии
  • 18 февраля 2019: реструктуризация репозитория с практической демонстрацией
Скачать инструмент
МодельСсылка на статью
Модели с учителем
LR[EuroSys'10] Fingerprinting the Datacenter: Automated Classification of Performance Crises, авторы: Peter Bodík, Moises Goldszmidt, Armando Fox, Hans Andersen. [Microsoft]
Decision Tree[ICAC'04] Failure Diagnosis Using Decision Trees, авторы: Mike Chen, Alice X. Zheng, Jim Lloyd, Michael I. Jordan, Eric Brewer. [eBay]
SVM[ICDM'07] Failure Prediction in IBM BlueGene/L Event Logs, авторы: Yinglung Liang, Yanyong Zhang, Hui Xiong, Ramendra Sahoo. [IBM]
Модели без учителя
LOF[SIGMOD'00] LOF: Identifying Density-Based Local Outliers, авторы: Markus M. Breunig, Hans-Peter Kriegel, Raymond T. Ng, Jörg Sander.
One-Class SVM[Neural Computation'01] Estimating the Support of a High-Dimensional Distribution, авторы: John Platt, Bernhard Schölkopf, John Shawe-Taylor, Alex J. Smola, Robert C. Williamson.
Isolation Forest[ICDM'08] Isolation Forest, авторы: Fei Tony Liu, Kai Ming Ting, Zhi-Hua Zhou.
PCA[SOSP'09] Large-Scale System Problems Detection by Mining Console Logs, авторы: Wei Xu, Ling Huang, Armando Fox, David Patterson, Michael I. Jordan. [Intel]
Invariants Mining[ATC'10] Mining Invariants from Console Logs for System Problem Detection, авторы: Jian-Guang Lou, Qiang Fu, Shengqi Yang, Ye Xu, Jiang Li. [Microsoft]
Clustering[ICSE'16] Log Clustering based Problem Identification for Online Service Systems, авторы: Qingwei Lin, Hongyu Zhang, Jian-Guang Lou, Yu Zhang, Xuewei Chen. [Microsoft]
DeepLog (скоро)[CCS'17] DeepLog: Anomaly Detection and Diagnosis from System Logs through Deep Learning, авторы: Min Du, Feifei Li, Guineng Zheng, Vivek Srikumar.
AutoEncoder (скоро)[Arxiv'18] Anomaly Detection using Autoencoders in High Performance Computing Systems, авторы: Andrea Borghesi, Andrea Bartolini, Michele Lombardi, Michela Milano, Luca Benini.
HDFS
МодельТочностьПолнотаF1
LR0.9550.9110.933
Decision Tree0.9980.9980.998
SVM0.9590.9700.965
LOF0.9670.5610.710
One-Class SVM0.9950.2220.363
Isolation Forest0.8300.7760.802
PCA0.9750.6350.769
Invariants Mining0.8880.9450.915
Clustering1.0000.7200.837