Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
loglizer — Un kit de herramientas de aprendizaje automático para la detección de anomalías basada en logs [ISSRE'16] | Kitploit
Herramientas/GitHubGitHub/logpai/loglizer
Aprendizaje AutomáticoDetección de AnomalíasAnálisis de Registros
GitHublogpai/loglizer

loglizer

Un kit de herramientas de aprendizaje automático para la detección de anomalías basada en logs [ISSRE'16]

Ver Repositorio
1.4k437hace 2 añosRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir

loglizer

Loglizer es un conjunto de herramientas de análisis de logs basado en aprendizaje automático para la detección automatizada de anomalías.

Loglizer es una herramienta de análisis de registros masivos basada en IA, utilizada para detección automática de anomalías y diagnóstico inteligente de fallos.

Los logs son imprescindibles en el proceso de desarrollo y mantenimiento de muchos sistemas de software. Registran información detallada del runtime durante la operación del sistema, lo que permite a los desarrolladores e ingenieros de soporte monitorizar sus sistemas y rastrear comportamientos anómalos y errores. Loglizer ofrece un conjunto de herramientas que implementa varias técnicas de análisis de logs basadas en aprendizaje automático para la detección automatizada de anomalías.

🔭 Si utilizas loglizer en tu investigación para una publicación, por favor cita el siguiente artículo.

  • Shilin He, Jieming Zhu, Pinjia He, Michael R. Lyu. Experience Report: System Log Analysis for Anomaly Detection, IEEE International Symposium on Software Reliability Engineering (ISSRE), 2016. [Bibtex][中文版本] (Artículo más influyente de ISSRE)

Marco de trabajo

Framework of Anomaly Detection

El marco de trabajo de análisis de logs para la detección de anomalías generalmente comprende los siguientes componentes:

  1. Recopilación de logs: Los logs se generan en tiempo de ejecución y se agregan en un lugar centralizado mediante un pipeline de transmisión de datos, como Flume y Kafka.
  2. Parseo de logs: El objetivo del parseo de logs es convertir los mensajes de log no estructurados en un mapa de eventos estructurados, sobre el cual se pueden aplicar modelos sofisticados de aprendizaje automático. Los detalles del parseo de logs se pueden encontrar en nuestro proyecto logparser.
  3. Extracción de características: Los logs estructurados se pueden dividir en secuencias de log cortas mediante ventanas de intervalo, ventanas deslizantes o ventanas de sesión. Luego, se realiza la extracción de características para vectorizar cada secuencia de log, por ejemplo, usando un vector de conteo de eventos.
  4. Detección de anomalías: Los modelos de detección de anomalías se entrenan para comprobar si un vector de características dado es una anomalía o no.

Modelos

Modelos de detección de anomalías actualmente disponibles:

Datos de log

Hemos recopilado un conjunto de datasets de logs etiquetados en loghub con fines de investigación. Si estás interesado en los datasets, sigue el enlace para enviar tu solicitud de acceso.

Instalación

root@kitploit:~
git clone https://github.com/logpai/loglizer.git
cd loglizer
pip install -r requirements.txt

Uso de la API

root@kitploit:~
# Load HDFS dataset. If you would like to try your own log, you need to rewrite the load function.
(x_train, y_train), (x_test, y_test) = dataloader.load_HDFS(...)

# Feature extraction and transformation
feature_extractor = preprocessing.FeatureExtractor()
feature_extractor.fit_transform(...) 

# Model training
model = PCA()
model.fit(...)

# Feature transform after fitting
x_test = feature_extractor.transform(...)
# Model evaluation with labeled data
model.evaluate(...)

# Anomaly prediction
x_test = feature_extractor.transform(...)
model.predict(...) # predict anomalies on given data

Para más detalles, sigue la demo en los docs para empezar. Ten en cuenta que todos los modelos de ML no son magia: necesitas averiguar cómo ajustar los parámetros para que funcionen con tus propios datos.

Resultados de benchmarking

Si deseas reproducir los siguientes resultados, ejecuta benchmarks/HDFS_bechmark.py sobre el dataset HDFS completo (HDFS100k es solo para la demo).

Contribuyentes

  • Shilin He, The Chinese University of Hong Kong
  • Jieming Zhu, The Chinese University of Hong Kong, actualmente en Huawei Noah's Ark Lab
  • Pinjia He, The Chinese University of Hong Kong, actualmente en ETH Zurich

Comentarios

Para cualquier pregunta o comentario, publica en la página de issues.

Historial

  • 14 de mayo de 2016: commit inicial
  • 21 de septiembre de 2017: actualización de código y readme
  • 21 de marzo de 2018: reescritura de la mayor parte del código y adición de comentarios detallados
  • 18 de febrero de 2019: reestructuración del repositorio con una demo práctica
Descargar herramienta
ModeloReferencia del artículo
Modelos supervisados
LR[EuroSys'10] Fingerprinting the Datacenter: Automated Classification of Performance Crises, by Peter Bodík, Moises Goldszmidt, Armando Fox, Hans Andersen. [Microsoft]
Decision Tree[ICAC'04] Failure Diagnosis Using Decision Trees, by Mike Chen, Alice X. Zheng, Jim Lloyd, Michael I. Jordan, Eric Brewer. [eBay]
SVM[ICDM'07] Failure Prediction in IBM BlueGene/L Event Logs, by Yinglung Liang, Yanyong Zhang, Hui Xiong, Ramendra Sahoo. [IBM]
Modelos no supervisados
LOF[SIGMOD'00] LOF: Identifying Density-Based Local Outliers, by Markus M. Breunig, Hans-Peter Kriegel, Raymond T. Ng, Jörg Sander.
One-Class SVM[Neural Computation'01] Estimating the Support of a High-Dimensional Distribution, by John Platt, Bernhard Schölkopf, John Shawe-Taylor, Alex J. Smola, Robert C. Williamson.
Isolation Forest[ICDM'08] Isolation Forest, by Fei Tony Liu, Kai Ming Ting, Zhi-Hua Zhou.
PCA[SOSP'09] Large-Scale System Problems Detection by Mining Console Logs, by Wei Xu, Ling Huang, Armando Fox, David Patterson, Michael I. Jordan. [Intel]
Invariants Mining[ATC'10] Mining Invariants from Console Logs for System Problem Detection, by Jian-Guang Lou, Qiang Fu, Shengqi Yang, Ye Xu, Jiang Li. [Microsoft]
Clustering[ICSE'16] Log Clustering based Problem Identification for Online Service Systems, by Qingwei Lin, Hongyu Zhang, Jian-Guang Lou, Yu Zhang, Xuewei Chen. [Microsoft]
DeepLog (próximamente)[CCS'17] DeepLog: Anomaly Detection and Diagnosis from System Logs through Deep Learning, by Min Du, Feifei Li, Guineng Zheng, Vivek Srikumar.
AutoEncoder (próximamente)[Arxiv'18] Anomaly Detection using Autoencoders in High Performance Computing Systems, by Andrea Borghesi, Andrea Bartolini, Michele Lombardi, Michela Milano, Luca Benini.
HDFS
ModeloPrecisiónRecallF1
LR0.9550.9110.933
Decision Tree0.9980.9980.998
SVM0.9590.9700.965
LOF0.9670.5610.710
One-Class SVM0.9950.2220.363
Isolation Forest0.8300.7760.802
PCA0.9750.6350.769
Invariants Mining0.8880.9450.915
Clustering1.0000.7200.837