Skip to content
KitploitKITPLOIT
OutilsExploitsBlog
Log in
Soumettre
OutilsExploitsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

FluxContactConfidentialité© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
TarantuBench — Le dépôt complet de tous les laboratoires disponibles dans le cadre du benchmark. | Kitploit
Outils/GitHubGitHub/trivulzianus/tarantubench
Authentification et AutorisationScanners de VulnérabilitésExploitation d'Applications WebSécurité WebCTFTests d'IntrusionApprentissage et ÉducationDéveloppement de Charges UtilesLabs et Pratique
GitHubtrivulzianus/tarantubench

TarantuBench

Le dépôt complet de tous les laboratoires disponibles dans le cadre du benchmark.

2113il y a 4 moisPas encore vérifié

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Voir le dépôt
Partager

TarantuBench v1

Un benchmark pour évaluer les agents IA sur des défis de sécurité web, généré par le moteur TarantuLabs.

Qu'est-ce que c'est ?

TarantuBench est une collection de 100 applications web vulnérables, chacune contenant un drapeau caché (TARANTU{...}). Le travail d'un agent est de trouver et d'extraire le drapeau en interagissant avec l'application via HTTP — exactement comme le ferait un pentesteur humain.

Les défis vont des contournements de connexion par injection SQL de niveau débutant aux chaînes d'attaque avancées en plusieurs étapes nécessitant l'exploitation de jusqu'à 5 vulnérabilités en séquence — incluant l'abus de logique métier, le XSS stocké pour le vol de session, la contrefaçon de JWT, le SSRF et l'injection SQL sur des API internes.

Chaque laboratoire est une application Node.js/Express autonome avec une base de données SQLite en mémoire. Aucune dépendance externe, aucun accès réseau nécessaire — il suffit de démarrer le serveur et de commencer à sonder.

Tous les défis de cette version ont été générés à l'aide du moteur de génération de laboratoires propriétaire de TarantuLabs.

v1 — Génération à grande échelle

TarantuBench v1 représente un benchmark mature et scalable, soutenu par un pipeline de génération éprouvé :

  • Débit. Le pipeline génère environ 100 laboratoires vérifiés par heure en utilisant Claude Opus avec pensée adaptative. Chaque laboratoire est une application web thématique complète avec une interface utilisateur réaliste, des données initiales, et une ou plusieurs vulnérabilités exploitables.
  • Vérification. Chaque laboratoire généré est validé de manière déterministe : démarrage du serveur, exécution d'un solveur généré automatiquement, et confirmation que le drapeau peut être extrait. Le pipeline atteint un taux de vérification de 93% au premier passage. Les laboratoires échoués sont automatiquement diagnostiqués et régénérés jusqu'à ce que l'ensemble du lot réussisse.
  • Node.js/Express par conception. Tous les laboratoires ciblent Node.js/Express — c'est un choix délibéré, pas une limitation. Cela permet à chaque défi de s'exécuter de manière interactive dans le navigateur via WebContainers sur tarantulabs.com, rendant le benchmark accessible sans aucune configuration locale.
  • Prochaines étapes. Les futures versions étendront l'infrastructure de vulnérabilité à d'autres frameworks serveur et langages, et exploreront des défis de sécurité au-delà des applications web — y compris l'exploitation binaire, la sécurité réseau et les attaques cryptographiques.

Démarrage rapide

Prérequis du harnais Node : Node.js 18+ et npm.

Prérequis de la tâche Inspect AI : Python 3.11+, Docker, et uv ou un autre installateur compatible PEP 517.

Le jeu de données des laboratoires exécutables est publié sur Hugging Face à tarantulabs/TarantuBench. Ce dépôt GitHub contient le harnais d'évaluation et la documentation.

git clone https://github.com/Trivulzianus/TarantuBench.git
cd TarantuBench
cd eval && npm install && cd ..

# Download the dataset file from Hugging Face, or clone the dataset repo:
# git clone https://huggingface.co/datasets/tarantulabs/TarantuBench data

# Run your agent against all 100 labs
node eval/harness.js --dataset data/tarantubench-v1.jsonl \
  --command "python my_agent.py --url {URL}" \
  --timeout 300

# Generate scorecard
node eval/scorecard.js

Avant d'exécuter une évaluation formelle, validez que le jeu de données local ou Hugging Face a le nombre de lignes et le schéma attendus :

node eval/validate-dataset.js --dataset data/tarantubench-v1.jsonl --expected-count 100
node eval/validate-dataset.js --hf tarantulabs/TarantuBench --expected-count 100

Le harnais démarre chaque laboratoire, place un proxy de journalisation transparent devant lui, et exécute votre commande d'agent (en remplaçant {URL} par l'adresse cible). Votre agent peut être écrit dans n'importe quel langage — il a juste besoin d'effectuer des requêtes HTTP et de soumettre le drapeau via POST {URL}/submit-flag avec le corps {"flag": "TARANTU{...}"}.

Exécuter un seul laboratoire manuellement

# Boot one lab in server mode — harness prints the URL, you connect your agent
node eval/harness.js --dataset data/tarantubench-v1.jsonl \
  --labs corporate-portal-chain-xss-idor \
  --mode server --timeout 300

Pourquoi ce benchmark ?

  • Évaluation sans ambiguïté : Soit l'agent extrait le drapeau, soit il ne le fait pas. Pas de crédit partiel, aucun jugement humain nécessaire.
  • Difficulté progressive : Du débutant (point d'injection unique) à l'avancé (chaînes d'exploitation en plusieurs étapes nécessitant 2 à 5 vulnérabilités chaînées).
  • Reproductible : Code serveur déterministe et aucune API externe. Le harnais génère un nouveau drapeau à chaque exécution, donc le comportement de l'exploit est reproductible tandis que la valeur littérale du drapeau change à chaque exécution.
  • Généré à grande échelle : Les laboratoires sont synthétisés par le moteur TarantuLabs, pas écrits à la main. Cela signifie que le benchmark peut croître de manière programmatique à mesure que nous ajoutons de nouveaux types de vulnérabilités et définitions de chaînes.

Schéma du jeu de données

Chaque ligne dans data/tarantubench-v1.jsonl représente un défi :

ColonneTypeDescription
lab_idstringIdentifiant unique
titlestringNom lisible du défi
descriptionstringBrève description du scénario (montrée à l'agent)
objectiveslist[string]Ce qu'on demande à l'agent d'accomplir
hintslist[string]Indices progressifs optionnels (pour études d'ablation)
difficultystringDébutant, Intermédiaire ou Avancé
categorystringFamille de vulnérabilité principale (ex. SQL Injection, XSS)
vuln_subtypestringTechnique spécifique (ex. sqli-union, xss-stored)
chain_typestring ou nullIdentifiant de chaîne multi-étapes, ou null pour les laboratoires à vulnérabilité unique
server_codestringCode source complet Node.js/Express de l'application vulnérable
dependenciesobjectDépendances npm nécessaires pour exécuter le serveur

Répartition des défis

Par difficulté

DifficultéNombreDescription
Débutant35Vulnérabilité unique, exploitation directe
Intermédiaire25Nécessite énumération, contournement de filtre ou logique multi-étapes
Avancé40Chaînes multi-étapes, failles de logique métier ou exploitation approfondie

Par catégorie

CatégorieNombre
Chaînes multi-vulnérabilités34
SQL Injection20
IDOR (Référence directe d'objet non sécurisée)11
Contournement d'authentification/autorisation10
XSS (Cross-Site Scripting)10
Logique métier8
Injection de commandes5
SSRF2

Défis en chaîne

34 des 100 laboratoires nécessitent le chaînage de plusieurs vulnérabilités :

Télécharger l’outil