
Multimodal-web-attack-Dataset — Updated!
Dieses Repository hostet einen multimodalen Web-Angriffsdatensatz (MWAD), um die KI-gestützte Forschung zur Bedrohungserkennung voranzutreiben.
MWAD: Ein multimodaler Webangriffsdatensatz für KI-gestützte SQL-Injection-Erkennung
Überblick
Der Multimodal Web Attack Dataset (MWAD) ist ein neuartiger gelabelter Cybersicherheitsdatensatz, der im Rahmen der Forschung des Autors im Bereich Cybersicherheit an der La Trobe University, Australien, entwickelt wurde.
Die Methodik zur Generierung des Datensatzes, sein Design und seine Beschreibung werden in dem peer-reviewten Fachartikel vorgestellt:
Yeboah, P. N., et al. (2026). SQL injection detection using self-supervised pre-training and multimodal techniques. Intelligent Systems with Applications, 31, 200702.
https://doi.org/10.1016/j.iswa.2026.200702
Im Gegensatz zu traditionellen Webangriffsdatensätzen, die typischerweise nur HTTP-Anfragen oder Netzwerkverkehr enthalten, integriert MWAD HTTP-Anfragedaten der Anwendungsschicht mit Netzwerkflussmerkmalen und bietet somit eine multimodale Repräsentation von Webangriffen.
MWAD wurde entwickelt, um die Entwicklung und Evaluierung von Modellen der künstlichen Intelligenz (KI) und des maschinellen Lernens (ML) zur Erkennung von Webangriffen zu unterstützen, mit besonderem Schwerpunkt auf SQL-Injection (SQLi). Durch die Kombination komplementärer Datenmodalitäten ermöglicht der Datensatz Forschern die Untersuchung multimodaler Lernansätze, die die Genauigkeit und Robustheit KI-gestützter Webangriffserkennung verbessern.
Jede MWAD-Stichprobe kombiniert zwei komplementäre Datenmodalitäten:
- HTTP-Anfragedaten, die den Inhalt und die Struktur von Webanfragen repräsentieren.
- Netzwerkflussmerkmale, die die Verhaltensmerkmale des entsprechenden Netzwerkverkehrs repräsentieren.
Pipeline zur Generierung des Datensatzes
Der Datensatz wurde in einer kontrollierten privaten Netzwerkumgebung unter Verwendung eines verwundbaren Webservers generiert, der auf einer Metasploitable-Virtual-Machine gehostet wurde.
SQL-Injection-Angriffe wurden mit SQLMap und SQL-Injection-Payloads ausgeführt. Der resultierende Verkehr wurde gesammelt und mit den folgenden Werkzeugen verarbeitet:
- Wireshark zur Protokollierung von HTTP-Anfragen
- Tcpdump zur Paketerfassung
- NFStream zur Extraktion von Netzwerkflussmerkmalen
Die HTTP-Anfragedaten und die entsprechenden Flussmerkmale wurden anschließend gelabelt und kombiniert, um den finalen multimodalen Datensatz zu erstellen.
Abbildung 1. MWAD-Generierungspipeline mit SQL-Injection-Ausführung, HTTP-Anfragenerfassung, Paketerfassung, Flussmerkmalsextraktion und multimodaler Datenintegration.
Zusammensetzung des Datensatzes
| Klasse | Anzahl der Stichproben | Beschreibung |
|---|---|---|
| Gutartig | 500 | Legitime Webanfragen und ihre entsprechenden Netzwerkflussmerkmale |
| SQL-Injection-Angriff | 500 | SQL-Injection-Anfragen und ihre entsprechenden Netzwerkflussmerkmale |
| Gesamt | 1.000 | Gelabelte multimodale Webverkehrsstichproben |
Datenmodalitäten
HTTP-Anfragemodalität
Die HTTP-Modalität enthält Informationen auf Anfrageebene, die während der Interaktionen mit der verwundbaren Webanwendung generiert wurden.
Diese Modalität kann unterstützen:
- textuelle Analyse von HTTP-Anfragen
- Erkennung schädlicher Payloads
- token-basiertes maschinelles Lernen
- Deep Learning und transformer-basierte Modellierung
- selbstüberwachtes Repräsentationslernen
Netzwerkflussmodalität
Die Netzwerkflussmodalität enthält statistische und verhaltensbezogene Merkmale, die mit NFStream aus dem erfassten Verkehr extrahiert wurden.
Diese Modalität kann unterstützen:
- Klassifizierung von Verkehrsflüssen
- Anomalieerkennung
- verhaltensbasierte Angriffsanalyse
- konventionelles maschinelles Lernen
- multimodale Fusion mit HTTP-Anfragerepräsentationen
Hauptmerkmale
- Öffentlich verfügbarer multimodaler Cybersicherheitsdatensatz
- Enthält gepaarte HTTP-Anfrage- und Netzwerkflussinformationen
- Enthält klar gelabelten gutartigen und SQL-Injection-Verkehr
- Ausgewogener Datensatz mit 500 Stichproben in jeder Klasse
- Generiert durch kontrollierte SQL-Injection-Experimente
- Unterstützt reproduzierbare Cybersicherheitsforschung
- Geeignet für unimodale und multimodale Modellbewertung
- Anwendbar auf maschinelles Lernen, Deep Learning und selbstüberwachtes Lernen
Neuartigkeit des Datensatzes
Viele Webangriffsdatensätze stellen entweder Informationen auf Anwendungsschichtebene oder Netzwerkverkehrsmerkmale getrennt bereit.
MWAD wurde entwickelt, um gepaarte Repräsentationen der Anwendungsschicht und der Netzwerkflüsse derselben Webinteraktionen bereitzustellen. Dies ermöglicht Forschern zu untersuchen, ob die Kombination der beiden Modalitäten die SQL-Injection-Erkennung im Vergleich zur alleinigen Nutzung einer der beiden Modalitäten verbessert.
Der Datensatz stellt somit eine wiederverwendbare Forschungsressource zur Untersuchung multimodaler Lern- und Datenfusionsstrategien bei der Erkennung von Webangriffen dar.
Zugehörige Veröffentlichung
Die Methodik zur Generierung des MWAD-Datensatzes, sein Design und seine Evaluierung werden in der folgenden peer-reviewten Publikation vorgestellt:
Intelligent Systems with Applications, Elsevier.
Zitation
Wenn Sie MWAD in Ihrer Forschung verwenden, zitieren Sie bitte:
@article{yeboah2026sql,
title={SQL injection detection using self-supervised pre-training and multimodal techniques},
author={Yeboah, Paul Ntim and Kayes, A. S. M. and Rahayu, Wenny and Pardede, Eric and Mahbub, Syed},
journal={Intelligent Systems with Applications},
volume={31},
pages={200702},
year={2026},
publisher={Elsevier},
doi={10.1016/j.iswa.2026.200702}
}