Este repositório hospeda um conjunto de dados multimodal de ataques web (MWAD) para avançar a pesquisa em detecção de ameaças orientada por IA.
O Multimodal Web Attack Dataset (MWAD) é um inovador conjunto de dados de cibersegurança rotulado, desenvolvido como parte da pesquisa do autor em cibersegurança na La Trobe University, Austrália.
A metodologia de geração, o design e a descrição do conjunto de dados são apresentados no artigo de periódico revisado por pares:
Yeboah, P. N., et al. (2026). SQL injection detection using self-supervised pre-training and multimodal techniques. Intelligent Systems with Applications, 31, 200702.
https://doi.org/10.1016/j.iswa.2026.200702
Ao contrário dos conjuntos de dados de ataques web tradicionais, que normalmente contêm apenas requisições HTTP ou tráfego de rede, o MWAD integra dados de requisições HTTP da camada de aplicação com características de fluxo de rede, fornecendo uma representação multimodal de ataques web.
O MWAD foi projetado para apoiar o desenvolvimento e a avaliação de modelos de inteligência artificial (IA) e aprendizado de máquina (ML) para detecção de ataques web, com foco especial em injeção de SQL (SQLi). Ao combinar modalidades de dados complementares, o conjunto de dados permite que pesquisadores investiguem abordagens de aprendizado multimodal que melhoram a precisão e a robustez da detecção de ataques web orientada por IA.
Cada amostra do MWAD combina duas modalidades de dados complementares:
O conjunto de dados foi gerado em um ambiente de rede privada controlado, usando um servidor web vulnerável hospedado em uma máquina virtual Metasploitable.
Os ataques de injeção de SQL foram executados usando SQLMap e payloads de injeção de SQL. O tráfego resultante foi coletado e processado usando as seguintes ferramentas:
Os dados de requisições HTTP e as características de fluxo correspondentes foram posteriormente rotulados e combinados para produzir o conjunto de dados multimodal final.
Figura 1. Pipeline de geração do MWAD mostrando a execução de injeção de SQL, coleta de requisições HTTP, captura de pacotes, extração de características de fluxo e integração de dados multimodais.
| Classe | Número de amostras | Descrição |
|---|---|---|
| Benigno | 500 | Requisições web legítimas e suas características de fluxo de rede correspondentes |
| Ataque de injeção de SQL | 500 | Requisições de injeção de SQL e suas características de fluxo de rede correspondentes |
| Total | 1.000 | Amostras rotuladas de tráfego web multimodal |
A modalidade HTTP contém informações no nível de requisição geradas durante as interações com a aplicação web vulnerável.
Esta modalidade pode apoiar:
A modalidade de fluxo de rede contém características estatísticas e comportamentais extraídas do tráfego capturado usando NFStream.
Esta modalidade pode apoiar:
Muitos conjuntos de dados de ataques web fornecem separadamente informações de requisições da camada de aplicação ou características de tráfego no nível de rede.
O MWAD foi desenvolvido para fornecer representações pareadas de camada de aplicação e fluxo de rede das mesmas interações web. Isso permite que pesquisadores examinem se a combinação das duas modalidades melhora a detecção de injeção de SQL em comparação com depender de cada modalidade isoladamente.
O conjunto de dados, portanto, fornece um recurso de pesquisa reutilizável para investigar aprendizado multimodal e estratégias de fusão de dados na detecção de ataques web.
A metodologia de geração, o design e a avaliação do conjunto de dados MWAD são apresentados na seguinte publicação revisada por pares:
Intelligent Systems with Applications, Elsevier.
Se você usar o MWAD em sua pesquisa, cite:
@article{yeboah2026sql,
title={SQL injection detection using self-supervised pre-training and multimodal techniques},
author={Yeboah, Paul Ntim and Kayes, A. S. M. and Rahayu, Wenny and Pardede, Eric and Mahbub, Syed},
journal={Intelligent Systems with Applications},
volume={31},
pages={200702},
year={2026},
publisher={Elsevier},
doi={10.1016/j.iswa.2026.200702}
}