Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
BoxPwnr — Un marco modular para la evaluación comparativa de LLMs y estrategias de agentes en desafíos de seguridad a través de HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF y más. | Kitploit
Herramientas/GitHubGitHub/0ca/boxpwnr
Escalada de PrivilegiosReconocimientoFrameworks de ExploitsGeneración de PayloadsAnálisis de VulnerabilidadesSeguridad WebCTFPruebas de PenetraciónAprendizaje y EducaciónSeguridad de IALabs y Práctica
443556hace 1 mesRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
GitHub
0ca/boxpwnr

BoxPwnr

Un marco modular para la evaluación comparativa de LLMs y estrategias de agentes en desafíos de seguridad a través de HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF y más.

Ver Repositorio

BoxPwnr

Un experimento divertido para ver hasta dónde pueden llegar los Modelos de Lenguaje de Gran Escala (LLMs) por sí solos resolviendo desafíos CTF y laboratorios de seguridad. Comenzó con HackTheBox y ahora abarca muchas plataformas y solucionadores agénticos.

BoxPwnr proporciona un sistema plug-and-play que se puede utilizar para probar el rendimiento de diferentes arquitecturas agénticas: --solver [claude_code, codex, cursor-cli, grok, kiro_cli, external, single_loop_xmltag, single_loop, single_loop_compactation, hacksynth].

Plataformas compatibles: --platform [htb, htb_ctf, htb_challenges, portswigger, ctfd, local, xbow, hackbench, cybench, cybergym, exploitbench, picoctf, tryhackme, levelupctf, argus]

Consulte Implementaciones de Plataformas para obtener documentación detallada sobre cada plataforma compatible.

Trazas y Benchmarks

Todas las trazas de resolución están disponibles en BoxPwnr Trazas y Benchmarks. Cada traza incluye registros completos de conversaciones que muestran el razonamiento del LLM, los comandos ejecutados y las salidas recibidas. Puede reproducir cualquier traza en un visor web interactivo para ver exactamente cómo se resolvió la máquina paso a paso.

🔬 BoxPwnr Trazas y Benchmarks

Total Challenges Challenges Solved Total Traces Platforms

Cómo Funciona

BoxPwnr utiliza LLMs (o agentes CLI como Claude Code, Codex, Grok o Cursor) para resolver de forma autónoma objetivos CTF / laboratorios a través de un proceso iterativo:

  1. Entorno: Por defecto, los comandos se ejecutan en un contenedor Docker con Kali Linux (--executor docker)
  • El contenedor se construye automáticamente en la primera ejecución (tarda ~10 minutos)
  • La conexión VPN se establece automáticamente cuando la plataforma lo requiere
  1. Bucle de Ejecución (solucionadores single_loop_* por defecto):
  • El LLM recibe un prompt del sistema detallado que define su tarea y restricciones
  • El LLM sugiere el siguiente comando basándose en las salidas anteriores
  • El comando se ejecuta en el ejecutor elegido
  • La salida se retroalimenta al LLM para su análisis
  • El proceso se repite hasta que se encuentra la bandera (o el criterio de éxito de la plataforma)
  • Los solucionadores basados en CLI (claude_code, codex, grok, cursor-cli, kiro_cli) ejecutan su propio bucle de agente y transmiten los resultados de vuelta a BoxPwnr
  1. Automatización de Comandos:
  • Se instruye a los agentes para que proporcionen comandos totalmente automatizados sin interacción manual
  • Los comandos deben incluir tiempos de espera adecuados y manejar demoras del servicio
  1. Resultados:
  • La conversación y los comandos se guardan como trazas para análisis/reproducción
  • Se puede generar un resumen cuando se encuentra una bandera
  • Se realiza un seguimiento de las estadísticas de uso (tokens, costo, turnos)

Uso

Requisitos Previos

  1. Clonar el repositorio con submódulos ```bash git clone --recurse-submodules https://github.com/0ca/BoxPwnr cd BoxPwnr

    Install uv if you haven't already

    curl -LsSf https://astral.sh/uv/install.sh | sh

    Sync dependencies (creates .venv)

    uv sync

root@kitploit:~
2. Docker
- BoxPwnr requiere que Docker esté instalado y en ejecución
- Las instrucciones de instalación se pueden encontrar en: [https://docs.docker.com/get-docker/](https://docs.docker.com/get-docker/)

### Ejecutar BoxPwnr```bash
uv run boxpwnr --platform htb --target meow [options]

En la primera ejecución, se te pedirán las claves de API necesarias. Las claves se guardan en .env para uso futuro. Los solucionadores CLI (Claude Code, Codex, Grok, Cursor, Kiro) utilizan su propia autenticación de suscripción en lugar de (o además de) las claves de API.

Opciones de Línea de Comandos

Opciones Principales

  • --platform: Plataforma a utilizar (htb, htb_ctf, htb_challenges, portswigger, ctfd, local, xbow, hackbench, cybench, cybergym, exploitbench, picoctf, tryhackme, levelupctf, argus)

Plataformas

  • --keep-target: Mantener el objetivo (máquina/laboratorio) en funcionamiento después de la finalización (útil para seguimiento manual)

Análisis e Informes

  • --analyze-attempt: Analizar intentos fallidos usando TraceAnalyzer después de la finalización
  • --generate-summary: Generar un resumen de la solución después de la finalización
  • --generate-progress: Generar un archivo de transferencia de progreso (progress.md) para intentos fallidos/interrumpidos. Este archivo se puede usar para reanudar el intento más tarde.
  • --resume-from: Ruta a un archivo progress.md de un intento anterior. El contenido se inyectará en el prompt del sistema para continuar desde donde se dejó el intento anterior.
  • --generate-report: Generar un nuevo informe desde un directorio de trazas existente

Selección de Solucionador LLM y Modelo

  • --solver: Solucionador LLM a utilizar (claude_code, codex, cursor-cli, grok, kiro_cli, external, single_loop_xmltag, single_loop, single_loop_compactation, hacksynth)
  • --model: Modelo de IA a utilizar (predeterminado: openrouter/openai/gpt-oss-120b). Los modelos compatibles incluyen:
    • Modelos Claude: Usar el nombre exacto del modelo de la API (ej., claude-sonnet-4-0, , )

Opciones del Solucionador Externo

El solucionador external permite a BoxPwnr delegar en cualquier herramienta externa (Claude Code, Aider, scripts personalizados, etc.):

  • --external-timeout: Tiempo de espera para el subproceso del solucionador externo en segundos (predeterminado: 3600)
  • Comando después de --: El comando externo a ejecutar (ej., -- claude -p "$BOXPWNR_PROMPT")

Variables de entorno disponibles para herramientas externas:

  • BOXPWNR_PROMPT: Prompt completo del sistema con información del objetivo
  • BOXPWNR_TARGET_IP: Información de conexión del objetivo (IP/hostname)
  • BOXPWNR_CONTAINER: Nombre del contenedor Docker (útil para escenarios VPN)

Ejecutores

BoxPwnr admite diferentes entornos para ejecutar comandos usando --executor:

  • docker (predeterminado): Ejecuta comandos dentro de un contenedor Docker de Kali Linux aislado que BoxPwnr construye y gestiona automáticamente. Esta es la opción recomendada para la mayoría de plataformas y casos de uso.
  • ssh: Ejecuta comandos en un host remoto vía SSH. Útil para configuraciones de red personalizadas o cuando se ejecuta en tu propia infraestructura. Requiere --ssh-host (y opcionalmente --ssh-username, --ssh-key-path, --ssh-port).
  • platform: Enruta comandos a través del attackbox/terminal propio de la plataforma (WebSocket). Esto es requerido cuando se usa --platform levelupctf.

Opciones relacionadas:

  • --keep-container: Mantener el contenedor Docker en ejecución después de la finalización (acelera siguientes intentos).
  • --architecture: Forzar una arquitectura de contenedor específica (amd64 es útil en Apple Silicon).
  • --image: Usar una imagen Docker personalizada en lugar de la imagen Kali incorporada.

Opciones Específicas de Plataforma

  • Opciones de HTB CTF:
    • --ctf-id: ID del evento CTF (requerido al usar --platform htb_ctf)
  • Opciones de CTFd:
    • --ctfd-url: URL de la instancia CTFd (requerido al usar --platform ctfd)
  • Opciones de ExploitBench:
    • --exploitbench-config: Nombre de configuración del benchmark (predeterminado: v8)
    • --exploitbench-success-cap: Capacidad que cuenta como éxito (predeterminado: ace)
    • --exploitbench-seed: Semilla del episodio (predeterminado: 1)

Ejemplos```bash

Regular use (container stops after execution)

uv run boxpwnr --platform htb --target meow --debug

Development mode (keeps container running for faster subsequent runs)

uv run boxpwnr --platform htb --target meow --debug --keep-container

Run on AMD64 architecture (useful for x86 compatibility on ARM systems like M1/M2 Macs)

uv run boxpwnr --platform htb --target meow --architecture amd64

Limit the number of turns

uv run boxpwnr --platform htb --target meow --max-turns 10

Limit the maximum cost

uv run boxpwnr --platform htb --target meow --max-cost 1.5

Run with multiple attempts for pass@5 benchmarks

uv run boxpwnr --platform htb --target meow --attempts 5

Use a specific model

uv run boxpwnr --platform htb --target meow --model claude-sonnet-4-0

Use Claude Haiku 4.5 (fast, cost-effective, and intelligent)

uv run boxpwnr --platform htb --target meow --model claude-haiku-4-5-20251001 --max-cost 0.5

Use GPT-5-mini (fast and cost-effective)

uv run boxpwnr --platform htb --target meow --model gpt-5-mini --max-cost 1.0

Use Grok-4 (advanced reasoning model)

uv run boxpwnr --platform htb --target meow --model grok-4 --max-cost 2.0

Use OpenRouter free tier (auto-routing)

uv run boxpwnr --platform htb --target meow --model openrouter/openrouter/free --max-cost 0.5

Use gpt-oss-120b via OpenRouter (open-weight 117B MoE model with reasoning)

uv run boxpwnr --platform htb --target meow --model openrouter/openai/gpt-oss-120b --max-cost 1.0

Use Kimi K2.5 via OpenRouter (Moonshot AI's reasoning model)

uv run boxpwnr --platform htb --target meow --model openrouter/moonshotai/kimi-k2.5 --max-cost 1.0

Use Cline free model (requires: npm install -g cline && cline auth)

uv run boxpwnr --platform htb --target meow --model cline/minimax/minimax-m2.5

Use Z.AI GLM-5 (Zhipu AI reasoning model)

uv run boxpwnr --platform htb --target meow --model z-ai/glm-5 --max-cost 1.0

Use Kilo free model (GLM-5 via Kilo gateway)

uv run boxpwnr --platform htb --target meow --model kilo/z-ai/glm-5

Use Kimi K2.5 directly (requires Kimi Code subscription)

uv run boxpwnr --platform htb --target meow --model kimi/kimi-k2.5 --max-cost 1.0

Use OpenCode free model (no authentication required)

uv run boxpwnr --platform htb --target meow --model opencode/big-pickle --max-cost 0.5

Use Claude Code solver (use CC as agent)

uv run boxpwnr --platform htb --target meow --solver claude_code --model claude-sonnet-4-0 --max-cost 2.0

Use Codex CLI solver (OpenAI Codex Max subscription)

uv run boxpwnr --platform htb --target meow --solver codex --model gpt-5.3-codex --max-time 60

Use Grok CLI solver (xAI subscription auth)

uv run boxpwnr --platform cybench --target "[Very Easy] Dynastic" --solver grok --max-time 60

Use Cursor CLI solver (Cursor Agent / subscription auth, Docker required)

uv run boxpwnr --platform htb --target meow --solver cursor-cli --model composer-2.5 --max-time 60

Use Kiro CLI solver

uv run boxpwnr --platform htb --target meow --solver kiro_cli --max-time 60

Use HackSynth solver (autonomous CTF agent with planner-executor-summarizer architecture)

uv run boxpwnr --platform htb --target meow --solver hacksynth --model gpt-5 --max-cost 1.0

Use single_loop_compactation solver for long-running traces that may exceed context limits

uv run boxpwnr --platform htb --target meow --solver single_loop_compactation --model gpt-5 --max-turns 100

Customize compaction behavior

uv run boxpwnr --platform htb --target meow --solver single_loop_compactation --compaction-threshold 0.70 --preserve-last-turns 15

Use NVIDIA NIM (API key) or nvidia-web playground (no API key)

uv run boxpwnr --platform htb --target meow --model nvidia/moonshotai/kimi-k2.6 --max-cost 1.0 uv run boxpwnr --platform htb --target meow --model nvidia-web/moonshotai/kimi-k2.6 --max-time 60

Generate a new report from existing attempt

uv run boxpwnr --generate-report machines/meow/traces/20250129_180409

Run an HTB challenge (app.hackthebox.com/challenges)

uv run boxpwnr --platform htb_challenges --target "Flag Command"

Run a CTF challenge

uv run boxpwnr --platform htb_ctf --ctf-id 1234 --target "Web Challenge"

Run a CTFd challenge

uv run boxpwnr --platform ctfd --ctfd-url https://ctf.example.com --target "Crypto 101"

Run with custom instructions

uv run boxpwnr --platform htb --target meow --custom-instructions "Focus on privilege escalation techniques and explain your steps in detail"

Generate a progress file for a failed attempt (can be resumed later)

uv run boxpwnr --platform htb --target meow --generate-progress --max-turns 20

Resume from a previous attempt using the generated progress file

uv run boxpwnr --platform htb --target meow --resume-from targets/htb/meow/traces/20250127_120000/progress.md --max-turns 30

Run XBOW benchmark (automatically clones benchmarks on first use)

uv run boxpwnr --platform xbow --target XBEN-060-24 --model gpt-5 --max-turns 30

List all available XBOW benchmarks

uv run boxpwnr --platform xbow --list

Run Cybench challenge (automatically clones repository on first use)

You can use either the short name or full path

uv run boxpwnr --platform cybench --target "[Very Easy] Dynastic" --model gpt-5 --max-cost 2.0

Or with full path:

uv run boxpwnr --platform cybench --target "benchmark/hackthebox/cyber-apocalypse-2024/crypto/[Very Easy] Dynastic" --model gpt-5 --max-cost 2.0

List all available Cybench challenges (40 professional CTF tasks)

uv run boxpwnr --platform cybench --list

Run ExploitBench (MCP grading; Grok works well here)

uv run boxpwnr --platform exploitbench --target sample-stack-bof --solver grok --exploitbench-success-cap ace --max-time 60 uv run boxpwnr --platform exploitbench --list

Run Argus challenge (Dockerized web vuln benchmarks; targets look like APEX-...)

uv run boxpwnr --platform argus --list uv run boxpwnr --platform argus --target APEX-001 --model gpt-5 --max-cost 1.0

Run CyberGym task (PoC that crashes the vulnerable build; IDs look like arvo:10013 or oss-fuzz:42535201)

uv run boxpwnr --platform cybergym --list uv run boxpwnr --platform cybergym --target arvo:10013 --model gpt-5 --max-cost 2.0

Use external solver with Claude Code (note: wrap in bash -c with single quotes)

uv run boxpwnr --platform htb --target meow --solver external -- bash -c 'claude --dangerously-skip-permissions -p "$BOXPWNR_PROMPT"'

Use external solver with OpenAI Codex CLI

uv run boxpwnr --platform htb --target meow --solver external -- bash -c 'codex --yolo "$BOXPWNR_PROMPT"'

Use external solver with custom timeout (2 hours)

uv run boxpwnr --platform htb --target meow --solver external --external-timeout 7200 -- bash -c 'claude --dangerously-skip-permissions -p "$BOXPWNR_PROMPT"'

Use external solver inside Docker container (for VPN scenarios)

When the target requires VPN, run the external tool inside BoxPwnr's Docker container.

IS_SANDBOX=1 allows --dangerously-skip-permissions to work as root.

uv run boxpwnr --platform htb --target meow --solver external --
bash -c 'docker exec -e IS_SANDBOX=1 -e ANTHROPIC_API_KEY="$ANTHROPIC_API_KEY" "$BOXPWNR_CONTAINER" claude --dangerously-skip-permissions -p "$BOXPWNR_PROMPT"'

root@kitploit:~
## ¿Por qué HackTheBox?

Las máquinas de HackTheBox proporcionan un excelente campo de pruebas integral para evaluar sistemas de IA porque requieren:

- Capacidades de razonamiento complejo
- Pensamiento creativo "fuera de lo común"
- Comprensión de diversos conceptos de seguridad
- Capacidad de encadenar múltiples pasos
- Habilidades dinámicas de resolución de problemas

## ¿Por qué ahora? *(escrito el 26 de enero de 2025)*

Con los recientes avances en tecnología LLM:

- Los modelos se están volviendo cada vez más sofisticados en sus capacidades de razonamiento
- El costo de ejecutar estos modelos está disminuyendo (ver DeepSeek R1 Zero)
- Su capacidad para comprender y generar código está mejorando
- Están mejorando en mantener el contexto y resolver problemas de múltiples pasos

Creo que en los próximos años, los LLMs tendrán la capacidad de resolver la mayoría de las máquinas HTB de forma autónoma, marcando un hito significativo en las capacidades de pruebas de seguridad con IA y resolución de problemas.

## Desarrollo

### Pruebas

BoxPwnr admite la ejecución de flujos de trabajo de GitHub Actions localmente usando `[act](https://github.com/nektos/act)`, que simula el entorno exacto de CI antes de subir a GitHub:```bash
# Install act (macOS)
brew install act

# Run CI workflows locally
make ci-test           # Run main test workflow
make ci-integration    # Run integration tests (slow - downloads Python each time)
make ci-docker         # Run docker build test
make ci-all            # Run all workflows

Descargo de responsabilidad

Este proyecto es solo para fines de investigación y educación. Siga siempre los términos de servicio y las pautas éticas de cada plataforma al utilizar esta herramienta.

Descargar herramienta
PlataformaResueltosCompletadoTrazas
HTB Starting Point25/25100.0%770
HTB Labs268/52651.0%783
HTB Challenges324/81839.6%732
PortSwigger Labs163/27060.4%377
XBOW102/10498.1%525
Cybench40/40100.0%2165
CyberGym476/150731.6%977
picoCTF502/50399.8%1215
TryHackMe213/47744.8%905
HackBench11/1668.8%27
ExploitBench2/424.8%58
LevelUpCTF50/25419.7%146
Argus47/6078.3%1026
BSidesSF CTF 202643/5184.3%76
Cloud Village CTF 202612/2060.0%30
Neurogrid CTF: The ultimate AI security showdown17/3647.2%197
  • --target: Nombre del objetivo (ej., meow para máquina HTB, "SQL injection UNION attack" para laboratorio PortSwigger, o XBEN-060-24 para benchmark XBOW)
  • --debug: Habilitar registro detallado (muestra nombres y descripciones de herramientas)
  • --debug-langchain: Habilitar modo depuración de LangChain (muestra solicitudes HTTP completas con esquemas de herramientas, trazas de LangChain y cargas útiles de API sin procesar - muy detallado)
  • --max-turns: Número máximo de turnos antes de detenerse (ej., --max-turns 10)
  • --max-cost: Costo máximo en USD antes de detenerse (ej., --max-cost 2.0)
  • --max-time: Tiempo máximo en minutos por intento (ej., --max-time 60)
  • --attempts: Número de intentos para resolver el objetivo (ej., --attempts 5 para benchmarks pass@5)
  • --default-execution-timeout: Tiempo de espera predeterminado para la ejecución de comandos en segundos (predeterminado: 30)
  • --max-execution-timeout: Tiempo de espera máximo para la ejecución de comandos en segundos (predeterminado: 300)
  • --custom-instructions: Instrucciones personalizadas adicionales para añadir al prompt del sistema
  • claude-opus-4-0
    claude-haiku-4-5-20251001
  • Modelos OpenAI: gpt-5, gpt-5-nano, gpt-5-mini
  • Otros modelos: deepseek-reasoner, grok-4, gemini-3-flash-preview
  • Modelos OpenRouter: openrouter/company/model (ej., openrouter/openrouter/free, openrouter/openai/gpt-oss-120b, openrouter/x-ai/grok-4-fast, openrouter/moonshotai/kimi-k2.5)
  • NVIDIA NIM: nvidia/company/model (ej., nvidia/moonshotai/kimi-k2.6) vía integrate.api.nvidia.com
  • NVIDIA playground (sin clave de API; Playwright): nvidia-web/company/model (ej., nvidia-web/moonshotai/kimi-k2.6)
  • Modelos Z.AI: z-ai/model-name (ej., z-ai/glm-5, z-ai/glm-5.2) para modelos Zhipu AI GLM
  • Modelos gratuitos Kilo: kilo/model-name (ej., kilo/z-ai/glm-5) vía gateway Kilo
  • Modelos Kimi: kimi/model-name (ej., kimi/kimi-k2.5, kimi/kimi-k2.7) para suscripción Kimi Code
  • Modelos gratuitos Cline: cline/minimax/minimax-m2.5, cline/moonshotai/kimi-k2.5 (requiere cline auth, ver más abajo)
  • Ollama Cloud: ollama-cloud/model-name (ej., ollama-cloud/minimax-m3:cloud)
  • Ollama local: ollama:model-name
  • --reasoning-effort: Nivel de esfuerzo de razonamiento para modelos con capacidad de razonamiento (minimal, low, medium, high). Solo se aplica a modelos que soportan razonamiento como gpt-5, o4-mini, grok-4. El valor predeterminado es medium para modelos de razonamiento.