Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
TarantuBench — El repositorio completo de todos los laboratorios disponibles como parte del benchmark. | Kitploit
Herramientas/GitHubGitHub/trivulzianus/tarantubench
Autenticación y AutorizaciónEscáneres de VulnerabilidadesExplotación de Aplicaciones WebSeguridad WebCTFPruebas de PenetraciónAprendizaje y EducaciónDesarrollo de PayloadsLabs y Práctica
GitHubtrivulzianus/tarantubench

TarantuBench

El repositorio completo de todos los laboratorios disponibles como parte del benchmark.

2110hace 4 mesesAún no revisado

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
Ver Repositorio

TarantuBench v1

Un benchmark para evaluar agentes de IA en desafíos de seguridad web, generado por el motor de TarantuLabs.

¿Qué es esto?

TarantuBench es una colección de 100 aplicaciones web vulnerables, cada una con una bandera oculta (TARANTU{...}). La tarea de un agente es encontrar y extraer la bandera interactuando con la aplicación a través de HTTP, como lo haría un pentester humano.

Los desafíos van desde bypass de login por inyección SQL de nivel principiante hasta cadenas de ataque avanzadas de múltiples pasos que requieren explotar hasta 5 vulnerabilidades en secuencia, incluyendo abuso de lógica de negocio, XSS almacenado para robo de sesión, falsificación de JWT, SSRF e inyección SQL en APIs internas.

Cada laboratorio es una aplicación Node.js/Express autocontenida con una base de datos SQLite en memoria. Sin dependencias externas, sin necesidad de acceso a la red: solo inicie el servidor y comience a sondear.

Todos los desafíos de esta versión fueron generados utilizando el motor patentado de generación de laboratorios de TarantuLabs.

v1 — Generación a escala

TarantuBench v1 representa un benchmark maduro y escalable respaldado por un pipeline de generación probado:

  • Throughput. El pipeline genera aproximadamente 100 laboratorios verificados por hora usando Claude Opus con pensamiento adaptativo. Cada laboratorio es una aplicación web temática completa con UI realista, datos semilla y una o más vulnerabilidades explotables.
  • Verificación. Cada laboratorio generado se valida de forma determinista: iniciar el servidor, ejecutar un solver generado automáticamente y confirmar que la bandera es extraíble. El pipeline alcanza una tasa de verificación del 93% en el primer intento. Los laboratorios fallidos se diagnostican y regeneran automáticamente hasta que todo el lote pasa.
  • Node.js/Express por diseño. Todos los laboratorios están dirigidos a Node.js/Express: esta es una elección deliberada, no una limitación. Permite que cada desafío se ejecute de forma interactiva en el navegador a través de WebContainers en tarantulabs.com, haciendo que el benchmark sea accesible sin necesidad de configuración local.
  • Próximos pasos. Las versiones futuras ampliarán la infraestructura de vulnerabilidades a otros frameworks y lenguajes de servidor, y explorarán desafíos de seguridad más allá de las aplicaciones web, incluida la explotación binaria, la seguridad de redes y los ataques criptográficos.

Inicio rápido

Requisitos del harness Node: Node.js 18+ y npm.

Requisitos de la tarea Inspect AI: Python 3.11+, Docker y uv u otro instalador compatible con PEP 517.

El conjunto de datos de laboratorios ejecutables se publica en Hugging Face en tarantulabs/TarantuBench. Este repositorio de GitHub contiene el harness de evaluación y la documentación.

git clone https://github.com/Trivulzianus/TarantuBench.git
cd TarantuBench
cd eval && npm install && cd ..

# Download the dataset file from Hugging Face, or clone the dataset repo:
# git clone https://huggingface.co/datasets/tarantulabs/TarantuBench data

# Run your agent against all 100 labs
node eval/harness.js --dataset data/tarantubench-v1.jsonl \
  --command "python my_agent.py --url {URL}" \
  --timeout 300

# Generate scorecard
node eval/scorecard.js

Antes de ejecutar una evaluación formal, valida que el conjunto de datos local o de Hugging Face tenga el número de filas y el esquema esperados:

node eval/validate-dataset.js --dataset data/tarantubench-v1.jsonl --expected-count 100
node eval/validate-dataset.js --hf tarantulabs/TarantuBench --expected-count 100

El harness inicia cada laboratorio, coloca un proxy de registro transparente delante de él y ejecuta el comando de tu agente (reemplazando {URL} con la dirección de destino). Tu agente puede escribirse en cualquier lenguaje: solo necesita hacer solicitudes HTTP y enviar la bandera a través de POST {URL}/submit-flag con el cuerpo {"flag": "TARANTU{...}"}.

Ejecutar un laboratorio manualmente

# Boot one lab in server mode — harness prints the URL, you connect your agent
node eval/harness.js --dataset data/tarantubench-v1.jsonl \
  --labs corporate-portal-chain-xss-idor \
  --mode server --timeout 300

¿Por qué este benchmark?

  • Evaluación inequívoca: o el agente extrae la bandera, o no lo hace. Sin crédito parcial, sin necesidad de juicio humano.
  • Dificultad graduada: desde principiante (un solo punto de inyección) hasta avanzado (cadenas de explotación de múltiples pasos que requieren 2–5 vulnerabilidades encadenadas).
  • Reproducible: código de servidor determinista y sin APIs externas. El harness genera una bandera nueva por ejecución, por lo que el comportamiento de explotación es reproducible mientras el valor literal de la bandera cambia en cada ejecución.
  • Generado a escala: los laboratorios son sintetizados por el motor TarantuLabs, no escritos a mano. Esto significa que el benchmark puede crecer programáticamente a medida que agregamos nuevos tipos de vulnerabilidad y definiciones de cadenas.

Esquema del conjunto de datos

Cada fila en data/tarantubench-v1.jsonl representa un desafío:

ColumnaTipoDescripción
lab_idstringIdentificador único
titlestringNombre del desafío legible para humanos
descriptionstringBreve descripción del escenario (mostrada al agente)
objectiveslist[string]Lo que se le dice al agente que logre
hintslist[string]Pistas progresivas opcionales (para estudios de ablación)
difficultystringBeginner, Intermediate o Advanced
categorystringFamilia de vulnerabilidad principal (p. ej., SQL Injection, XSS)
vuln_subtypestringTécnica específica (p. ej., sqli-union, xss-stored)
chain_typestring o nullID de cadena de múltiples pasos, o null para laboratorios de una sola vulnerabilidad
server_codestringCódigo fuente completo de Node.js/Express para la aplicación vulnerable
dependenciesobjectDependencias de paquetes npm necesarias para ejecutar el servidor

Desglose de desafíos

Por dificultad

DificultadConteoDescripción
Principiante35Vulnerabilidad única, explotación directa
Intermedio25Requiere enumeración, bypass de filtros o lógica de múltiples pasos
Avanzado40Cadenas de múltiples pasos, fallos de lógica de negocio o explotación profunda

Por categoría

CategoríaConteo
Multi-Vulnerability Chains34
SQL Injection20
IDOR (Insecure Direct Object Reference)11
Auth/Authz Bypass10
XSS (Cross-Site Scripting)10
Business Logic8
Command Injection5
SSRF2

Desafíos en cadena

34 de los 100 laboratorios requieren encadenar múltiples vulnerabilidades:

Descargar herramienta