Torna agli aggiornamenti
UpdatedJul 27, 2026

Multimodal-web-attack-Dataset — Updated!

Questo repository ospita un dataset multimodale di attacchi web (MWAD) per avanzare la ricerca sulla rilevazione delle minacce guidata dall'IA.

Condividi

MWAD: Un dataset multimodale di attacchi web per il rilevamento di SQL injection basato su IA

Panoramica

Il Multimodal Web Attack Dataset (MWAD) è un nuovo dataset etichettato per la cybersecurity sviluppato come parte della ricerca dell'autore in cybersecurity presso La Trobe University, Australia.

La metodologia di generazione, progettazione e descrizione del dataset sono presentate nell'articolo sottoposto a revisione paritaria:

Yeboah, P. N., et al. (2026). Rilevamento di SQL injection mediante pre-addestramento auto-supervisionato e tecniche multimodali. Intelligent Systems with Applications, 31, 200702.
https://doi.org/10.1016/j.iswa.2026.200702

A differenza dei dataset tradizionali di attacchi web che tipicamente contengono solo richieste HTTP o traffico di rete, MWAD integra dati delle richieste HTTP a livello applicativo con caratteristiche di flusso di rete, fornendo una rappresentazione multimodale degli attacchi web.

MWAD è progettato per supportare lo sviluppo e la valutazione di modelli di intelligenza artificiale (IA) e apprendimento automatico (ML) per il rilevamento di attacchi web, con un focus particolare su SQL injection (SQLi). Combinando modalità di dati complementari, il dataset consente ai ricercatori di investigare approcci di apprendimento multimodale che migliorano l'accuratezza e la robustezza del rilevamento di attacchi web basato su IA.

Ogni campione MWAD combina due modalità di dati complementari:

  1. Dati delle richieste HTTP, che rappresentano il contenuto e la struttura delle richieste web.
  2. Caratteristiche del flusso di rete, che rappresentano le caratteristiche comportamentali del corrispondente traffico di rete.

Pipeline di generazione del dataset

Il dataset è stato generato in un ambiente di rete privata controllata utilizzando un web server vulnerabile ospitato su una macchina virtuale Metasploitable.

Gli attacchi SQL injection sono stati eseguiti utilizzando SQLMap e payload di SQL injection. Il traffico risultante è stato raccolto ed elaborato utilizzando i seguenti strumenti:

  • Wireshark per la registrazione delle richieste HTTP
  • Tcpdump per la cattura dei pacchetti
  • NFStream per l'estrazione delle caratteristiche del flusso di rete

I dati delle richieste HTTP e le corrispondenti caratteristiche a livello di flusso sono stati successivamente etichettati e combinati per produrre il dataset multimodale finale.

Pipeline di generazione del dataset multimodale MWAD

Figura 1. Pipeline di generazione MWAD che mostra l'esecuzione di SQL injection, la raccolta delle richieste HTTP, la cattura dei pacchetti, l'estrazione delle caratteristiche del flusso e l'integrazione dei dati multimodali.


Composizione del dataset

ClasseNumero di campioniDescrizione
Benigno500Richieste web legittime e le corrispondenti caratteristiche del flusso di rete
Attacco SQL injection500Richieste di SQL injection e le corrispondenti caratteristiche del flusso di rete
Totale1,000Campioni di traffico web multimodale etichettati

Modalità dei dati

Modalità delle richieste HTTP

La modalità HTTP contiene informazioni a livello di richiesta generate durante le interazioni con l'applicazione web vulnerabile.

Questa modalità può supportare:

  • analisi testuale delle richieste HTTP
  • rilevamento di payload dannosi
  • apprendimento automatico basato su token
  • apprendimento profondo e modellazione basata su transformer
  • apprendimento di rappresentazioni auto-supervisionato

Modalità del flusso di rete

La modalità del flusso di rete contiene caratteristiche statistiche e comportamentali estratte dal traffico catturato utilizzando NFStream.

Questa modalità può supportare:

  • classificazione del flusso di traffico
  • rilevamento di anomalie
  • analisi comportamentale degli attacchi
  • apprendimento automatico convenzionale
  • fusione multimodale con rappresentazioni delle richieste HTTP

Caratteristiche principali

  • Dataset multimodale di cybersecurity disponibile pubblicamente
  • Contiene informazioni accoppiate di richiesta HTTP e flusso di rete
  • Include traffico benigno e di SQL injection chiaramente etichettato
  • Dataset bilanciato contenente 500 campioni per ciascuna classe
  • Generato attraverso esperimenti controllati di SQL injection
  • Supporta la ricerca riproducibile in cybersecurity
  • Adatto per la valutazione di modelli unimodali e multimodali
  • Applicabile all'apprendimento automatico, apprendimento profondo e apprendimento auto-supervisionato

Novità del dataset

Molti dataset di attacchi web forniscono separatamente o informazioni sulle richieste a livello applicativo o caratteristiche del traffico a livello di rete.

MWAD è stato sviluppato per fornire rappresentazioni accoppiate a livello applicativo e di flusso di rete delle stesse interazioni web. Ciò consente ai ricercatori di esaminare se la combinazione delle due modalità migliora il rilevamento di SQL injection rispetto all'affidamento su una sola modalità indipendentemente.

Il dataset fornisce quindi una risorsa di ricerca riutilizzabile per investigare strategie di apprendimento multimodale e fusione di dati nel rilevamento di attacchi web.


Pubblicazione associata

La metodologia di generazione, progettazione e valutazione del dataset MWAD sono presentate nella seguente pubblicazione sottoposta a revisione paritaria:

Intelligent Systems with Applications, Elsevier.

Citazione

Se utilizzi MWAD nella tua ricerca, cita:

@article{yeboah2026sql,
  title={SQL injection detection using self-supervised pre-training and multimodal techniques},
  author={Yeboah, Paul Ntim and Kayes, A. S. M. and Rahayu, Wenny and Pardede, Eric and Mahbub, Syed},
  journal={Intelligent Systems with Applications},
  volume={31},
  pages={200702},
  year={2026},
  publisher={Elsevier},
  doi={10.1016/j.iswa.2026.200702}
}

Categorie