Skip to content
KitploitKITPLOIT
ToolsExploitsBlog
Log in
Einreichen
ToolsExploitsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
TarantuBench — Das vollständige Repository aller Labs, die im Rahmen des Benchmarks verfügbar sind. | Kitploit
Tools/GitHubGitHub/trivulzianus/tarantubench
Authentifizierung & AutorisierungSchwachstellenscannerWebanwendungs-ExploitationWebsicherheitCTFPenetrationstestsLernen & BildungPayload-EntwicklungLabs & Praxis
GitHubtrivulzianus/tarantubench

TarantuBench

Das vollständige Repository aller Labs, die im Rahmen des Benchmarks verfügbar sind.

2111vor 4 MonatenNoch nicht geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen
Repository anzeigen

TarantuBench v1

Ein Benchmark zur Bewertung von KI-Agenten bei Web-Sicherheitsherausforderungen, generiert von der TarantuLabs-Engine.

Was ist das?

TarantuBench ist eine Sammlung von 100 angreifbaren Webanwendungen, die jeweils eine versteckte Flagge (TARANTU{...}) enthalten. Die Aufgabe eines Agenten ist es, die Flagge zu finden und zu extrahieren, indem er über HTTP mit der Anwendung interagiert – genau wie ein menschlicher Pentester.

Die Herausforderungen reichen von SQL-Injection-Login-Bypässen auf Anfängerniveau bis hin zu fortgeschrittenen mehrstufigen Angriffsketten, die das Ausnutzen von bis zu 5 Schwachstellen in Folge erfordern – darunter Missbrauch von Geschäftslogik, gespeichertes XSS zum Diebstahl von Sitzungen, JWT-Fälschung, SSRF und SQL-Injection auf internen APIs.

Jedes Labor ist eine eigenständige Node.js/Express-Anwendung mit einer SQLite-In-Memory-Datenbank. Keine externen Abhängigkeiten, kein Netzwerkzugriff erforderlich – einfach den Server starten und mit dem Sondieren beginnen.

Alle Herausforderungen in dieser Version wurden mit der proprietären Lab-Generierungs-Engine von TarantuLabs erstellt.

v1 — Generation im großen Maßstab

TarantuBench v1 stellt einen ausgereiften, skalierbaren Benchmark dar, der von einer bewährten Generierungspipeline unterstützt wird:

  • Durchsatz. Die Pipeline generiert etwa 100 verifizierte Labs pro Stunde mit Claude Opus und adaptivem Denken. Jedes Lab ist eine vollständige, thematische Webanwendung mit realistischer Benutzeroberfläche, Ausgangsdaten und einer oder mehreren ausnutzbaren Schwachstellen.
  • Verifizierung. Jedes generierte Lab wird deterministisch validiert: Server starten, einen automatisch generierten Solver ausführen und bestätigen, dass die Flagge extrahierbar ist. Die Pipeline erreicht eine Erstprüfungsrate von 93%. Fehlgeschlagene Labs werden automatisch diagnostiziert und neu generiert, bis der gesamte Batch besteht.
  • Node.js/Express by design. Alle Labs zielen auf Node.js/Express ab – dies ist eine bewusste Entscheidung, keine Einschränkung. Es ermöglicht, dass jede Herausforderung interaktiv im Browser über WebContainers auf tarantulabs.com läuft, wodurch der Benchmark ohne lokale Einrichtung zugänglich ist.
  • Was als Nächstes kommt. Zukünftige Versionen werden die Schwachstelleninfrastruktur auf zusätzliche Server-Frameworks und Sprachen erweitern und Sicherheitsherausforderungen jenseits von Webanwendungen erkunden – einschließlich Binärausnutzung, Netzwerksicherheit und kryptografischer Angriffe.

Schnellstart

Node-Harness-Anforderungen: Node.js 18+ und npm.

Inspect AI-Aufgabenanforderungen: Python 3.11+, Docker und uv oder ein anderer PEP 517-kompatibler Installer.

Der ausführbare Lab-Datensatz ist auf Hugging Face unter tarantulabs/TarantuBench veröffentlicht. Dieses GitHub-Repository enthält die Evaluierungs-Harness und Dokumentation.

git clone https://github.com/Trivulzianus/TarantuBench.git
cd TarantuBench
cd eval && npm install && cd ..

# Download the dataset file from Hugging Face, or clone the dataset repo:
# git clone https://huggingface.co/datasets/tarantulabs/TarantuBench data

# Run your agent against all 100 labs
node eval/harness.js --dataset data/tarantubench-v1.jsonl \
  --command "python my_agent.py --url {URL}" \
  --timeout 300

# Generate scorecard
node eval/scorecard.js

Vor der Durchführung einer formellen Evaluierung validieren Sie, dass der lokale oder Hugging-Face-Datensatz die erwartete Zeilenanzahl und das Schema hat:

node eval/validate-dataset.js --dataset data/tarantubench-v1.jsonl --expected-count 100
node eval/validate-dataset.js --hf tarantulabs/TarantuBench --expected-count 100

Die Harness startet jedes Lab, platziert einen transparenten Logging-Proxy davor und führt Ihren Agentenbefehl aus (ersetzt {URL} durch die Zieladresse). Ihr Agent kann in jeder Sprache geschrieben sein – er muss nur HTTP-Anfragen stellen und die Flagge über POST {URL}/submit-flag mit dem Body {"flag": "TARANTU{...}"} übermitteln.

Ein einzelnes Lab manuell ausführen

# Boot one lab in server mode — harness prints the URL, you connect your agent
node eval/harness.js --dataset data/tarantubench-v1.jsonl \
  --labs corporate-portal-chain-xss-idor \
  --mode server --timeout 300

Warum dieser Benchmark?

  • Eindeutige Bewertung: Entweder extrahiert der Agent die Flagge oder nicht. Keine Teilpunkte, kein menschliches Urteil erforderlich.
  • Abgestufte Schwierigkeit: Vom Anfänger (einzelner Injektionspunkt) bis zum Fortgeschrittenen (mehrstufige Exploit-Ketten, die 2–5 verkettete Schwachstellen erfordern).
  • Reproduzierbar: Deterministischer Servercode und keine externen APIs. Die Harness generiert eine neue Flagge pro Durchlauf, sodass das Exploit-Verhalten reproduzierbar ist, während sich der tatsächliche Flaggenwert bei jedem Durchlauf ändert.
  • In großem Maßstab generiert: Labs werden von der TarantuLabs-Engine synthetisiert, nicht von Hand geschrieben. Das bedeutet, dass der Benchmark programmatisch wachsen kann, wenn wir neue Schwachstellentypen und Ketten-Definitionen hinzufügen.

Datensatz-Schema

Jede Zeile in data/tarantubench-v1.jsonl repräsentiert eine Herausforderung:

SpalteTypBeschreibung
lab_idstringEindeutige Kennung
titlestringMenschenlesbarer Herausforderungsname
descriptionstringKurze Szenariobeschreibung (dem Agenten gezeigt)
objectiveslist[string]Was dem Agenten zu erreichen gesagt wird
hintslist[string]Optionale progressive Hinweise (für Ablationsstudien)
difficultystringBeginner, Intermediate oder Advanced
categorystringPrimäre Schwachstellenfamilie (z.B. SQL-Injection, XSS)
vuln_subtypestringSpezifische Technik (z.B. sqli-union, xss-stored)
chain_typestring oder nullMehrstufige Ketten-ID oder null für Labs mit einer Schwachstelle
server_codestringVollständiger Node.js/Express-Quellcode für die angreifbare Anwendung
dependenciesobjectnpm-Paketabhängigkeiten, die zum Ausführen des Servers benötigt werden

Aufschlüsselung der Herausforderungen

Nach Schwierigkeit

SchwierigkeitAnzahlBeschreibung
Anfänger35Einzelne Schwachstelle, direkte Ausnutzung
Mittelstufe25Erfordert Enumeration, Filterumgehung oder mehrstufige Logik
Fortgeschritten40Mehrstufige Ketten, Schwachstellen in der Geschäftslogik oder tiefgehende Ausnutzung

Nach Kategorie

KategorieAnzahl
Multi-Schwachstellen-Ketten34
SQL-Injection20
IDOR (Insecure Direct Object Reference)11
Authentifizierungs-/Autorisierungsumgehung10
XSS (Cross-Site Scripting)10
Geschäftslogik8
Befehlseinschleusung5
SSRF2

Ketten-Herausforderungen

34 der 100 Labs erfordern die Verkettung mehrerer Schwachstellen:

Tool herunterladen