
Multimodal-web-attack-Dataset — Updated!
Questo repository ospita un dataset multimodale di attacchi web (MWAD) per avanzare la ricerca sulla rilevazione delle minacce guidata dall'IA.
MWAD: Un dataset multimodale di attacchi web per il rilevamento di SQL injection basato su IA
Panoramica
Il Multimodal Web Attack Dataset (MWAD) è un nuovo dataset etichettato per la cybersecurity sviluppato come parte della ricerca dell'autore in cybersecurity presso La Trobe University, Australia.
La metodologia di generazione, progettazione e descrizione del dataset sono presentate nell'articolo sottoposto a revisione paritaria:
Yeboah, P. N., et al. (2026). Rilevamento di SQL injection mediante pre-addestramento auto-supervisionato e tecniche multimodali. Intelligent Systems with Applications, 31, 200702.
https://doi.org/10.1016/j.iswa.2026.200702
A differenza dei dataset tradizionali di attacchi web che tipicamente contengono solo richieste HTTP o traffico di rete, MWAD integra dati delle richieste HTTP a livello applicativo con caratteristiche di flusso di rete, fornendo una rappresentazione multimodale degli attacchi web.
MWAD è progettato per supportare lo sviluppo e la valutazione di modelli di intelligenza artificiale (IA) e apprendimento automatico (ML) per il rilevamento di attacchi web, con un focus particolare su SQL injection (SQLi). Combinando modalità di dati complementari, il dataset consente ai ricercatori di investigare approcci di apprendimento multimodale che migliorano l'accuratezza e la robustezza del rilevamento di attacchi web basato su IA.
Ogni campione MWAD combina due modalità di dati complementari:
- Dati delle richieste HTTP, che rappresentano il contenuto e la struttura delle richieste web.
- Caratteristiche del flusso di rete, che rappresentano le caratteristiche comportamentali del corrispondente traffico di rete.
Pipeline di generazione del dataset
Il dataset è stato generato in un ambiente di rete privata controllata utilizzando un web server vulnerabile ospitato su una macchina virtuale Metasploitable.
Gli attacchi SQL injection sono stati eseguiti utilizzando SQLMap e payload di SQL injection. Il traffico risultante è stato raccolto ed elaborato utilizzando i seguenti strumenti:
- Wireshark per la registrazione delle richieste HTTP
- Tcpdump per la cattura dei pacchetti
- NFStream per l'estrazione delle caratteristiche del flusso di rete
I dati delle richieste HTTP e le corrispondenti caratteristiche a livello di flusso sono stati successivamente etichettati e combinati per produrre il dataset multimodale finale.
Figura 1. Pipeline di generazione MWAD che mostra l'esecuzione di SQL injection, la raccolta delle richieste HTTP, la cattura dei pacchetti, l'estrazione delle caratteristiche del flusso e l'integrazione dei dati multimodali.
Composizione del dataset
| Classe | Numero di campioni | Descrizione |
|---|---|---|
| Benigno | 500 | Richieste web legittime e le corrispondenti caratteristiche del flusso di rete |
| Attacco SQL injection | 500 | Richieste di SQL injection e le corrispondenti caratteristiche del flusso di rete |
| Totale | 1,000 | Campioni di traffico web multimodale etichettati |
Modalità dei dati
Modalità delle richieste HTTP
La modalità HTTP contiene informazioni a livello di richiesta generate durante le interazioni con l'applicazione web vulnerabile.
Questa modalità può supportare:
- analisi testuale delle richieste HTTP
- rilevamento di payload dannosi
- apprendimento automatico basato su token
- apprendimento profondo e modellazione basata su transformer
- apprendimento di rappresentazioni auto-supervisionato
Modalità del flusso di rete
La modalità del flusso di rete contiene caratteristiche statistiche e comportamentali estratte dal traffico catturato utilizzando NFStream.
Questa modalità può supportare:
- classificazione del flusso di traffico
- rilevamento di anomalie
- analisi comportamentale degli attacchi
- apprendimento automatico convenzionale
- fusione multimodale con rappresentazioni delle richieste HTTP
Caratteristiche principali
- Dataset multimodale di cybersecurity disponibile pubblicamente
- Contiene informazioni accoppiate di richiesta HTTP e flusso di rete
- Include traffico benigno e di SQL injection chiaramente etichettato
- Dataset bilanciato contenente 500 campioni per ciascuna classe
- Generato attraverso esperimenti controllati di SQL injection
- Supporta la ricerca riproducibile in cybersecurity
- Adatto per la valutazione di modelli unimodali e multimodali
- Applicabile all'apprendimento automatico, apprendimento profondo e apprendimento auto-supervisionato
Novità del dataset
Molti dataset di attacchi web forniscono separatamente o informazioni sulle richieste a livello applicativo o caratteristiche del traffico a livello di rete.
MWAD è stato sviluppato per fornire rappresentazioni accoppiate a livello applicativo e di flusso di rete delle stesse interazioni web. Ciò consente ai ricercatori di esaminare se la combinazione delle due modalità migliora il rilevamento di SQL injection rispetto all'affidamento su una sola modalità indipendentemente.
Il dataset fornisce quindi una risorsa di ricerca riutilizzabile per investigare strategie di apprendimento multimodale e fusione di dati nel rilevamento di attacchi web.
Pubblicazione associata
La metodologia di generazione, progettazione e valutazione del dataset MWAD sono presentate nella seguente pubblicazione sottoposta a revisione paritaria:
Intelligent Systems with Applications, Elsevier.
Citazione
Se utilizzi MWAD nella tua ricerca, cita:
@article{yeboah2026sql,
title={SQL injection detection using self-supervised pre-training and multimodal techniques},
author={Yeboah, Paul Ntim and Kayes, A. S. M. and Rahayu, Wenny and Pardede, Eric and Mahbub, Syed},
journal={Intelligent Systems with Applications},
volume={31},
pages={200702},
year={2026},
publisher={Elsevier},
doi={10.1016/j.iswa.2026.200702}
}