Voltar às atualizações
UpdatedJul 27, 2026

Multimodal-web-attack-Dataset — Updated!

Este repositório hospeda um conjunto de dados multimodal de ataques web (MWAD) para avançar a pesquisa em detecção de ameaças orientada por IA.

Compartilhar

MWAD: Um Conjunto de Dados Multimodal de Ataques Web para Detecção de Injeção de SQL Orientada por IA

Visão Geral

O Multimodal Web Attack Dataset (MWAD) é um inovador conjunto de dados de cibersegurança rotulado, desenvolvido como parte da pesquisa do autor em cibersegurança na La Trobe University, Austrália.

A metodologia de geração, o design e a descrição do conjunto de dados são apresentados no artigo de periódico revisado por pares:

Yeboah, P. N., et al. (2026). SQL injection detection using self-supervised pre-training and multimodal techniques. Intelligent Systems with Applications, 31, 200702.
https://doi.org/10.1016/j.iswa.2026.200702

Ao contrário dos conjuntos de dados de ataques web tradicionais, que normalmente contêm apenas requisições HTTP ou tráfego de rede, o MWAD integra dados de requisições HTTP da camada de aplicação com características de fluxo de rede, fornecendo uma representação multimodal de ataques web.

O MWAD foi projetado para apoiar o desenvolvimento e a avaliação de modelos de inteligência artificial (IA) e aprendizado de máquina (ML) para detecção de ataques web, com foco especial em injeção de SQL (SQLi). Ao combinar modalidades de dados complementares, o conjunto de dados permite que pesquisadores investiguem abordagens de aprendizado multimodal que melhoram a precisão e a robustez da detecção de ataques web orientada por IA.

Cada amostra do MWAD combina duas modalidades de dados complementares:

  1. Dados de requisições HTTP, que representam o conteúdo e a estrutura das requisições web.
  2. Características de fluxo de rede, que representam as características comportamentais do tráfego de rede correspondente.

Pipeline de Geração do Conjunto de Dados

O conjunto de dados foi gerado em um ambiente de rede privada controlado, usando um servidor web vulnerável hospedado em uma máquina virtual Metasploitable.

Os ataques de injeção de SQL foram executados usando SQLMap e payloads de injeção de SQL. O tráfego resultante foi coletado e processado usando as seguintes ferramentas:

  • Wireshark para registro de requisições HTTP
  • Tcpdump para captura de pacotes
  • NFStream para extração de características de fluxo de rede

Os dados de requisições HTTP e as características de fluxo correspondentes foram posteriormente rotulados e combinados para produzir o conjunto de dados multimodal final.

Pipeline de geração do conjunto de dados multimodal MWAD

Figura 1. Pipeline de geração do MWAD mostrando a execução de injeção de SQL, coleta de requisições HTTP, captura de pacotes, extração de características de fluxo e integração de dados multimodais.


Composição do Conjunto de Dados

ClasseNúmero de amostrasDescrição
Benigno500Requisições web legítimas e suas características de fluxo de rede correspondentes
Ataque de injeção de SQL500Requisições de injeção de SQL e suas características de fluxo de rede correspondentes
Total1.000Amostras rotuladas de tráfego web multimodal

Modalidades de Dados

Modalidade de Requisições HTTP

A modalidade HTTP contém informações no nível de requisição geradas durante as interações com a aplicação web vulnerável.

Esta modalidade pode apoiar:

  • análise textual de requisições HTTP
  • detecção de payloads maliciosos
  • aprendizado de máquina baseado em tokens
  • aprendizado profundo e modelagem baseada em transformers
  • aprendizado de representação autossupervisionado

Modalidade de Fluxo de Rede

A modalidade de fluxo de rede contém características estatísticas e comportamentais extraídas do tráfego capturado usando NFStream.

Esta modalidade pode apoiar:

  • classificação de fluxo de tráfego
  • detecção de anomalias
  • análise comportamental de ataques
  • aprendizado de máquina convencional
  • fusão multimodal com representações de requisições HTTP

Principais Características

  • Conjunto de dados multimodal de cibersegurança disponível publicamente
  • Contém informações pareadas de requisições HTTP e fluxo de rede
  • Inclui tráfego benigno e de injeção de SQL claramente rotulado
  • Conjunto de dados balanceado contendo 500 amostras em cada classe
  • Gerado por meio de experimentos controlados de injeção de SQL
  • Apoia pesquisa reprodutível em cibersegurança
  • Adequado para avaliação de modelos unimodais e multimodais
  • Aplicável a aprendizado de máquina, aprendizado profundo e aprendizado autossupervisionado

Novidade do Conjunto de Dados

Muitos conjuntos de dados de ataques web fornecem separadamente informações de requisições da camada de aplicação ou características de tráfego no nível de rede.

O MWAD foi desenvolvido para fornecer representações pareadas de camada de aplicação e fluxo de rede das mesmas interações web. Isso permite que pesquisadores examinem se a combinação das duas modalidades melhora a detecção de injeção de SQL em comparação com depender de cada modalidade isoladamente.

O conjunto de dados, portanto, fornece um recurso de pesquisa reutilizável para investigar aprendizado multimodal e estratégias de fusão de dados na detecção de ataques web.


Publicação Associada

A metodologia de geração, o design e a avaliação do conjunto de dados MWAD são apresentados na seguinte publicação revisada por pares:

Intelligent Systems with Applications, Elsevier.

Citação

Se você usar o MWAD em sua pesquisa, cite:

@article{yeboah2026sql,
  title={SQL injection detection using self-supervised pre-training and multimodal techniques},
  author={Yeboah, Paul Ntim and Kayes, A. S. M. and Rahayu, Wenny and Pardede, Eric and Mahbub, Syed},
  journal={Intelligent Systems with Applications},
  volume={31},
  pages={200702},
  year={2026},
  publisher={Elsevier},
  doi={10.1016/j.iswa.2026.200702}
}

Categorias