
Multimodal-web-attack-Dataset — Actualizado!
Este repositorio alberga un conjunto de datos multimodal de ataques web (MWAD) para impulsar la investigación de detección de amenazas impulsada por IA.
MWAD: Un conjunto de datos multimodal de ataques web para la detección de inyección SQL basada en IA
Descripción general
El conjunto de datos multimodal de ataques web (MWAD) es un novedoso conjunto de datos etiquetado de ciberseguridad desarrollado como parte de la investigación del autor en ciberseguridad en La Trobe University, Australia.
La metodología de generación, el diseño y la descripción del conjunto de datos se presentan en el artículo de revista revisado por pares:
Yeboah, P. N., et al. (2026). SQL injection detection using self-supervised pre-training and multimodal techniques. Intelligent Systems with Applications, 31, 200702.
https://doi.org/10.1016/j.iswa.2026.200702
A diferencia de los conjuntos de datos de ataques web tradicionales que suelen contener únicamente solicitudes HTTP o tráfico de red, MWAD integra datos de solicitudes HTTP de la capa de aplicación con características de flujo de red, lo que proporciona una representación multimodal de los ataques web.
MWAD está diseñado para apoyar el desarrollo y la evaluación de modelos de inteligencia artificial (IA) y aprendizaje automático (ML) para la detección de ataques web, con un enfoque particular en la inyección SQL (SQLi). Al combinar modalidades de datos complementarias, el conjunto de datos permite a los investigadores investigar enfoques de aprendizaje multimodal que mejoran la precisión y la robustez de la detección de ataques web impulsada por IA.
Cada muestra de MWAD combina dos modalidades de datos complementarias:
- Datos de solicitudes HTTP, que representan el contenido y la estructura de las solicitudes web.
- Características de flujo de red, que representan las características de comportamiento del tráfico de red correspondiente.
Canal de generación del conjunto de datos
El conjunto de datos se generó en un entorno de red privada controlado utilizando un servidor web vulnerable alojado en una máquina virtual Metasploitable.
Los ataques de inyección SQL se ejecutaron utilizando SQLMap y payloads de inyección SQL. El tráfico resultante se recopiló y procesó con las siguientes herramientas:
- Wireshark para el registro de solicitudes HTTP
- Tcpdump para la captura de paquetes
- NFStream para la extracción de características de flujo de red
Los datos de solicitudes HTTP y las características de flujo correspondientes se etiquetaron posteriormente y se combinaron para producir el conjunto de datos multimodal final.
Figura 1. Canal de generación de MWAD que muestra la ejecución de inyección SQL, la recopilación de solicitudes HTTP, la captura de paquetes, la extracción de características de flujo y la integración de datos multimodales.
Composición del conjunto de datos
| Clase | Número de muestras | Descripción |
|---|---|---|
| Benigna | 500 | Solicitudes web legítimas y sus características de flujo de red correspondientes |
| Ataque de inyección SQL | 500 | Solicitudes de inyección SQL y sus características de flujo de red correspondientes |
| Total | 1,000 | Muestras de tráfico web multimodal etiquetadas |
Modalidades de datos
Modalidad de solicitud HTTP
La modalidad HTTP contiene información a nivel de solicitud generada durante las interacciones con la aplicación web vulnerable.
Esta modalidad puede admitir:
- análisis textual de solicitudes HTTP
- detección de payloads maliciosos
- aprendizaje automático basado en tokens
- modelado de aprendizaje profundo y basado en transformadores
- aprendizaje de representación autosupervisado
Modalidad de flujo de red
La modalidad de flujo de red contiene características estadísticas y de comportamiento extraídas del tráfico capturado mediante NFStream.
Esta modalidad puede admitir:
- clasificación de flujos de tráfico
- detección de anomalías
- análisis de ataques de comportamiento
- aprendizaje automático convencional
- fusión multimodal con representaciones de solicitudes HTTP
Características principales
- Conjunto de datos de ciberseguridad multimodal disponible públicamente
- Contiene información emparejada de solicitudes HTTP y flujo de red
- Incluye tráfico benigno y de inyección SQL claramente etiquetado
- Conjunto de datos equilibrado que contiene 500 muestras en cada clase
- Generado mediante experimentos controlados de inyección SQL
- Admite investigación reproducible en ciberseguridad
- Adecuado para la evaluación de modelos unimodales y multimodales
- Aplicable al aprendizaje automático, el aprendizaje profundo y el aprendizaje autosupervisado
Novedad del conjunto de datos
Muchos conjuntos de datos de ataques web proporcionan información de solicitudes de la capa de aplicación o características del tráfico de red por separado.
MWAD se desarrolló para proporcionar representaciones emparejadas de la capa de aplicación y de flujo de red de las mismas interacciones web. Esto permite a los investigadores examinar si la combinación de las dos modalidades mejora la detección de inyección SQL en comparación con depender de cualquiera de las modalidades de forma independiente.
Por lo tanto, el conjunto de datos proporciona un recurso de investigación reutilizable para investigar el aprendizaje multimodal y las estrategias de fusión de datos en la detección de ataques web.
Publicación asociada
La metodología de generación, el diseño y la evaluación del conjunto de datos MWAD se presentan en la siguiente publicación revisada por pares:
Intelligent Systems with Applications, Elsevier.
Citación
Si utiliza MWAD en su investigación, cite:
@article{yeboah2026sql,
title={SQL injection detection using self-supervised pre-training and multimodal techniques},
author={Yeboah, Paul Ntim and Kayes, A. S. M. and Rahayu, Wenny and Pardede, Eric and Mahbub, Syed},
journal={Intelligent Systems with Applications},
volume={31},
pages={200702},
year={2026},
publisher={Elsevier},
doi={10.1016/j.iswa.2026.200702}
}