Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
BoxPwnr — Un marco modular para la evaluación comparativa de LLMs y estrategias de agentes en desafíos de seguridad a través de HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF y más. | Kitploit
Herramientas/GitHubGitHub/0ca/boxpwnr
Escalada de PrivilegiosReconocimientoFrameworks de ExploitsGeneración de PayloadsAnálisis de VulnerabilidadesSeguridad WebCTFPruebas de PenetraciónAprendizaje y EducaciónSeguridad de IALabs y Práctica
4435524hace 2 mesesRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
GitHub
0ca/boxpwnr

BoxPwnr

Un marco modular para la evaluación comparativa de LLMs y estrategias de agentes en desafíos de seguridad a través de HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF y más.

Ver Repositorio

BoxPwnr

Un experimento divertido para ver hasta dónde pueden llegar los Modelos de Lenguaje de Gran Escala (LLMs) por sí solos resolviendo desafíos CTF y laboratorios de seguridad. Comenzó con HackTheBox y ahora abarca muchas plataformas y solucionadores agénticos.

BoxPwnr proporciona un sistema plug-and-play que se puede utilizar para probar el rendimiento de diferentes arquitecturas agénticas: --solver [claude_code, codex, cursor-cli, grok, kiro_cli, external, single_loop_xmltag, single_loop, single_loop_compactation, hacksynth].

Plataformas compatibles: --platform [htb, htb_ctf, htb_challenges, portswigger, ctfd, local, xbow, hackbench, cybench, cybergym, exploitbench, picoctf, tryhackme, levelupctf, argus]

Consulte Implementaciones de Plataformas para obtener documentación detallada sobre cada plataforma compatible.

Trazas y Benchmarks

Todas las trazas de resolución están disponibles en BoxPwnr Trazas y Benchmarks. Cada traza incluye registros completos de conversaciones que muestran el razonamiento del LLM, los comandos ejecutados y las salidas recibidas. Puede reproducir cualquier traza en un visor web interactivo para ver exactamente cómo se resolvió la máquina paso a paso.

🔬 BoxPwnr Trazas y Benchmarks

Total Challenges Challenges Solved Total Traces Platforms

PlataformaResueltosCompletadoTrazas
HTB Starting Point25/25100.0%770
HTB Labs268/52651.0%783
HTB Challenges324/81839.6%732
PortSwigger Labs163/27060.4%377
XBOW102/10498.1%525
Cybench40/40100.0%2165
CyberGym476/150731.6%977
picoCTF502/50399.8%1215
TryHackMe213/47744.8%905
HackBench11/1668.8%27
ExploitBench2/424.8%58
LevelUpCTF50/25419.7%146
Argus47/6078.3%1026
BSidesSF CTF 202643/5184.3%76
Cloud Village CTF 202612/2060.0%30
Neurogrid CTF: The ultimate AI security showdown17/3647.2%197

Cómo Funciona

BoxPwnr utiliza LLMs (o agentes CLI como Claude Code, Codex, Grok o Cursor) para resolver de forma autónoma objetivos CTF / laboratorios a través de un proceso iterativo:

  1. Entorno: Por defecto, los comandos se ejecutan en un contenedor Docker con Kali Linux (--executor docker)
  • El contenedor se construye automáticamente en la primera ejecución (tarda ~10 minutos)
  • La conexión VPN se establece automáticamente cuando la plataforma lo requiere
  1. Bucle de Ejecución (solucionadores single_loop_* por defecto):
  • El LLM recibe un prompt del sistema detallado que define su tarea y restricciones
  • El LLM sugiere el siguiente comando basándose en las salidas anteriores
  • El comando se ejecuta en el ejecutor elegido
  • La salida se retroalimenta al LLM para su análisis
  • El proceso se repite hasta que se encuentra la bandera (o el criterio de éxito de la plataforma)
  • Los solucionadores basados en CLI (claude_code, codex, grok, cursor-cli, kiro_cli) ejecutan su propio bucle de agente y transmiten los resultados de vuelta a BoxPwnr
  1. Automatización de Comandos:
  • Se instruye a los agentes para que proporcionen comandos totalmente automatizados sin interacción manual
  • Los comandos deben incluir tiempos de espera adecuados y manejar demoras del servicio
  1. Resultados:
  • La conversación y los comandos se guardan como trazas para análisis/reproducción
  • Se puede generar un resumen cuando se encuentra una bandera
  • Se realiza un seguimiento de las estadísticas de uso (tokens, costo, turnos)

Uso

Requisitos Previos

  1. Clonar el repositorio con submódulos ```bash git clone --recurse-submodules https://github.com/0ca/BoxPwnr cd BoxPwnr

    Install uv if you haven't already

    curl -LsSf https://astral.sh/uv/install.sh | sh

    Sync dependencies (creates .venv)

    uv sync

2. Docker
- BoxPwnr requiere que Docker esté instalado y en ejecución
- Las instrucciones de instalación se pueden encontrar en: [https://docs.docker.com/get-docker/](https://docs.docker.com/get-docker/)

### Ejecutar BoxPwnr```bash
uv run boxpwnr --platform htb --target meow [options]

En la primera ejecución, se te pedirán las claves de API necesarias. Las claves se guardan en .env para uso futuro. Los solucionadores CLI (Claude Code, Codex, Grok, Cursor, Kiro) utilizan su propia autenticación de suscripción en lugar de (o además de) las claves de API.

Opciones de Línea de Comandos

Opciones Principales

Descargar herramienta