Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
TarantuBench — Il repository completo di tutti i laboratori disponibili come parte del benchmark. | Kitploit
Strumenti/GitHubGitHub/trivulzianus/tarantubench
Autenticazione e AutorizzazioneScanner di VulnerabilitàSfruttamento di Applicazioni WebSicurezza WebCTFPenetration TestingApprendimento e FormazioneSviluppo PayloadLab e Pratica
GitHubtrivulzianus/tarantubench

TarantuBench

Il repository completo di tutti i laboratori disponibili come parte del benchmark.

21114 mesi faNon ancora revisionato

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi
Vedi Repository

TarantuBench v1

Un benchmark per valutare agenti AI su sfide di sicurezza web, generato dal motore TarantuLabs.

Cos'è?

TarantuBench è una raccolta di 100 applicazioni web vulnerabili, ciascuna contenente una flag nascosta (TARANTU{...}). Il compito di un agente è trovare ed estrarre la flag interagendo con l'applicazione via HTTP — proprio come farebbe un pentester umano.

Le sfide spaziano da bypass di login tramite SQL injection a livello principiante a catene di attacco multi-step avanzate che richiedono lo sfruttamento fino a 5 vulnerabilità in sequenza — inclusi abusi di logica di business, XSS persistente per il furto di sessione, contraffazione JWT, SSRF e SQL injection su API interne.

Ogni lab è un'applicazione Node.js/Express autonoma con un database SQLite in memoria. Nessuna dipendenza esterna, nessun accesso di rete necessario — basta avviare il server e iniziare a sondare.

Tutte le sfide in questa release sono state generate utilizzando il motore di generazione di lab proprietario di TarantuLabs.

v1 — Generazione su Larga Scala

TarantuBench v1 rappresenta un benchmark maturo e scalabile supportato da una pipeline di generazione collaudata:

  • Throughput. La pipeline genera circa 100 lab verificati all'ora utilizzando Claude Opus con pensiero adattivo. Ogni lab è un'applicazione web tematica completa con UI realistica, dati di seed e una o più vulnerabilità sfruttabili.
  • Verifica. Ogni lab generato viene validato deterministicamente: avvia il server, esegui un solver generato automaticamente e conferma che la flag sia estraibile. La pipeline raggiunge un tasso di verifica al primo passaggio del 93%. I lab falliti vengono diagnosticati automaticamente e rigenerati fino al superamento dell'intero lotto.
  • Node.js/Express di proposito. Tutti i lab hanno come target Node.js/Express — questa è una scelta deliberata, non una limitazione. Permette a ogni sfida di essere eseguita in modo interattivo nel browser tramite WebContainers su tarantulabs.com, rendendo il benchmark accessibile senza alcuna configurazione locale.
  • Prossimi passi. Le versioni future espanderanno l'infrastruttura di vulnerabilità ad altri framework e linguaggi server, ed esploreranno sfide di sicurezza oltre le applicazioni web — inclusi exploit binari, sicurezza di rete e attacchi crittografici.

Avvio Rapido

Requisiti del Node harness: Node.js 18+ e npm.

Requisiti del task Inspect AI: Python 3.11+, Docker e uv o un altro installer compatibile con PEP 517.

Il dataset di lab eseguibili è pubblicato su Hugging Face all'indirizzo tarantulabs/TarantuBench. Questo repository GitHub contiene l'harness di valutazione e la documentazione.

git clone https://github.com/Trivulzianus/TarantuBench.git
cd TarantuBench
cd eval && npm install && cd ..

# Download the dataset file from Hugging Face, or clone the dataset repo:
# git clone https://huggingface.co/datasets/tarantulabs/TarantuBench data

# Run your agent against all 100 labs
node eval/harness.js --dataset data/tarantubench-v1.jsonl \
  --command "python my_agent.py --url {URL}" \
  --timeout 300

# Generate scorecard
node eval/scorecard.js

Prima di eseguire una valutazione formale, verifica che il dataset locale o su Hugging Face abbia il conteggio di righe e lo schema previsti:

node eval/validate-dataset.js --dataset data/tarantubench-v1.jsonl --expected-count 100
node eval/validate-dataset.js --hf tarantulabs/TarantuBench --expected-count 100

L'harness avvia ogni lab, posiziona un proxy di logging trasparente davanti ad esso, ed esegue il comando del tuo agente (sostituendo {URL} con l'indirizzo target). Il tuo agente può essere scritto in qualsiasi linguaggio — deve solo effettuare richieste HTTP e inviare la flag tramite POST {URL}/submit-flag con corpo {"flag": "TARANTU{...}"}.

Eseguire un Singolo Lab Manualmente

# Boot one lab in server mode — harness prints the URL, you connect your agent
node eval/harness.js --dataset data/tarantubench-v1.jsonl \
  --labs corporate-portal-chain-xss-idor \
  --mode server --timeout 300

Perché questo benchmark?

  • Valutazione inequivocabile: O l'agente estrae la flag, oppure no. Nessun punteggio parziale, nessun giudizio umano necessario.
  • Difficoltà graduata: Dal principiante (singolo punto di injection) all'avanzato (catene di exploit multi-step che richiedono 2–5 vulnerabilità concatenate).
  • Riproducibile: Codice server deterministico e nessuna API esterna. L'harness genera una flag fresca per ogni esecuzione, quindi il comportamento dell'exploit è riproducibile mentre il valore letterale della flag cambia ogni run.
  • Generato su larga scala: I lab sono sintetizzati dal motore TarantuLabs, non scritti a mano. Ciò significa che il benchmark può crescere programmaticamente man mano che aggiungiamo nuovi tipi di vulnerabilità e definizioni di catene.

Schema del Dataset

Ogni riga in data/tarantubench-v1.jsonl rappresenta una sfida:

ColonnaTipoDescrizione
lab_idstringIdentificatore univoco
titlestringNome della sfida leggibile dall'uomo
descriptionstringBreve descrizione dello scenario (mostrato all'agente)
objectiveslist[string]Cosa viene detto all'agente di raggiungere
hintslist[string]Suggerimenti progressivi opzionali (per studi di ablazione)
difficultystringPrincipiante, Intermedio o Avanzato
categorystringFamiglia di vulnerabilità principale (es. SQL Injection, XSS)
vuln_subtypestringTecnica specifica (es. sqli-union, xss-stored)
chain_typestring o nullIdentificatore della catena multi-step, o null per lab a singola vulnerabilità
server_codestringCodice sorgente Node.js/Express completo dell'applicazione vulnerabile
dependenciesobjectDipendenze npm necessarie per eseguire il server

Riepilogo delle Sfide

Per Difficoltà

DifficoltàConteggioDescrizione
Principiante35Singola vulnerabilità, sfruttamento diretto
Intermedio25Richiede enumerazione, bypass di filtri o logica multi-step
Avanzato40Catene multi-step, falle nella logica di business o sfruttamento profondo

Per Categoria

CategoriaConteggio
Catene Multi-Vulnerabilità34
SQL Injection20
IDOR (Riferimento Diretto ad Oggetto Non Sicuro)11
Bypass Autenticazione/Autorizzazione10
XSS (Cross-Site Scripting)10
Logica di Business8
Iniezione di Comandi5
SSRF2

Sfide a Catena

34 dei 100 lab richiedono il concatenamento di più vulnerabilità:

Tipo di CatenaConteggioPassi
SSRF → SQL Injection8Bypass del controllo accessi tramite SSRF, poi estrazione flag tramite SQLi
SSRF → Blind SQLi5SSRF per raggiungere un endpoint interno, poi estrazione booleana cieca
XSS → SQL Injection7Rubare la sessione admin tramite XSS persistente, poi usare la ricerca riservata admin con SQLi
XSS → IDOR5Rubare la sessione admin tramite XSS persistente, poi accedere a dati nascosti tramite IDOR
JWT Forgery → Blind SQLi4Forzare un segreto JWT debole, forgiare un token elevato, estrarre la flag carattere per carattere
JWT Forgery → IDOR3Forzare JWT, forgiare un ruolo elevato, accedere a endpoint API riservati
Biz Logic → XSS → JWT → SSRF → SQLi1Catena a 5 passi attraverso abuso di referral, furto di sessione, contraffazione JWT, pivot SSRF e SQLi union
XSS → JWT → SSRF → SQLi1Catena a 4 passi attraverso furto di sessione, contraffazione JWT, SSRF e SQL injection

Temi delle Applicazioni

Scarica lo strumento