Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
BoxPwnr — Um framework modular para benchmarking de LLMs e estratégias agentivas em desafios de segurança através de HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF e mais. | Kitploit
Ferramentas/GitHubGitHub/0ca/boxpwnr
Escalada de PrivilégiosReconhecimentoFrameworks de ExploraçãoGeração de PayloadsAnálise de VulnerabilidadesSegurança WebCTFTestes de PenetraçãoAprendizado e EducaçãoSegurança de IALabs e Prática
44355há 1 mêsRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar
GitHub
0ca/boxpwnr

BoxPwnr

Um framework modular para benchmarking de LLMs e estratégias agentivas em desafios de segurança através de HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF e mais.

Ver Repositório

BoxPwnr

Um experimento divertido para ver até onde os Modelos de Linguagem de Grande Escala (LLMs) podem ir na resolução autônoma de desafios CTF e laboratórios de segurança. Tudo começou com HackTheBox e agora abrange muitas plataformas e solvers baseados em agentes.

O BoxPwnr fornece um sistema plug and play que pode ser usado para testar o desempenho de diferentes arquiteturas de agentes: --solver [claude_code, codex, cursor-cli, grok, kiro_cli, external, single_loop_xmltag, single_loop, single_loop_compactation, hacksynth].

Plataformas suportadas: --platform [htb, htb_ctf, htb_challenges, portswigger, ctfd, local, xbow, hackbench, cybergym, exploitbench, picoctf, tryhackme, levelupctf, argus]

Consulte Implementações de Plataforma para documentação detalhada sobre cada plataforma suportada.

Traces e Benchmarks

Todos os traces de resolução estão disponíveis em BoxPwnr Traces & Benchmarks. Cada trace inclui logs completos da conversa, mostrando o raciocínio do LLM, os comandos executados e as saídas recebidas. Você pode reproduzir qualquer trace em um visualizador web interativo para ver exatamente como a máquina foi resolvida, passo a passo.

🔬 BoxPwnr Traces & Benchmarks

Total Challenges Challenges Solved Total Traces Platforms

Como Funciona

O BoxPwnr usa LLMs (ou agentes CLI como Claude Code, Codex, Grok ou Cursor) para resolver autonomamente alvos de CTF / laboratórios por meio de um processo iterativo:

  1. Ambiente: Por padrão, os comandos são executados em um contêiner Docker com Kali Linux (--executor docker)
  • O contêiner é construído automaticamente na primeira execução (leva ~10 minutos)
  • A conexão VPN é estabelecida automaticamente quando a plataforma exige
  1. Loop de Execução (solvers padrão single_loop_*):
  • O LLM recebe um system prompt detalhado que define sua tarefa e restrições
  • O LLM sugere o próximo comando com base nas saídas anteriores
  • O comando é executado no executor escolhido
  • A saída é realimentada ao LLM para análise
  • O processo se repete até que a flag seja capturada (ou os critérios de sucesso da plataforma sejam atendidos)
  • Solvers baseados em CLI (claude_code, codex, grok, cursor-cli, kiro_cli) executam seu próprio loop de agente e transmitem os resultados de volta ao BoxPwnr
  1. Automação de Comandos:
  • Os agentes são instruídos a fornecer comandos totalmente automatizados, sem interação manual
  • Os comandos devem incluir timeouts adequados e lidar com atrasos de serviço
  1. Resultados:
  • A conversa e os comandos são salvos como traces para análise / reprodução
  • Um resumo pode ser gerado quando uma flag é encontrada
  • Estatísticas de uso (tokens, custo, turnos) são rastreadas

Uso

Pré-requisitos

  1. Clone o repositório com submódulos ```bash git clone --recurse-submodules https://github.com/0ca/BoxPwnr cd BoxPwnr

    Install uv if you haven't already

    curl -LsSf https://astral.sh/uv/install.sh | sh

    Sync dependencies (creates .venv)

    uv sync

root@kitploit:~
2. Docker
- O BoxPwnr requer que o Docker esteja instalado e em execução
- As instruções de instalação podem ser encontradas em: [https://docs.docker.com/get-docker/](https://docs.docker.com/get-docker/)

### Executar o BoxPwnr```bash
uv run boxpwnr --platform htb --target meow [options]

Na primeira execução, você será solicitado a fornecer as chaves de API necessárias. As chaves são salvas no .env para uso futuro. Os solvers de CLI (Claude Code, Codex, Grok, Cursor, Kiro) usam sua própria autenticação por assinatura em vez de (ou além de) chaves de API.

Opções de Linha de Comando

Opções Principais

  • --platform: Plataforma a usar (htb, htb_ctf, htb_challenges, portswigger, ctfd, local, xbow, hackbench, cybench, cybergym, exploitbench, picoctf, tryhackme, levelupctf, argus)

Plataformas

  • --keep-target: Mantém o alvo (máquina/laboratório) em execução após a conclusão (útil para acompanhamento manual)

Análise e Relatórios

  • --analyze-attempt: Analisa tentativas falhas usando o TraceAnalyzer após a conclusão
  • --generate-summary: Gera um resumo da solução após a conclusão
  • --generate-progress: Gera um arquivo de transferência de progresso (progress.md) para tentativas falhas/interrompidas. Esse arquivo pode ser usado para retomar a tentativa posteriormente.
  • --resume-from: Caminho para um arquivo progress.md de uma tentativa anterior. O conteúdo será injetado no prompt do sistema para continuar de onde a tentativa anterior parou.
  • --generate-report: Gera um novo relatório a partir de um diretório de rastreamento existente

Seleção de Solver LLM e Modelo

  • --solver: Solver LLM a usar (claude_code, codex, cursor-cli, grok, kiro_cli, external, single_loop_xmltag, single_loop, single_loop_compactation, hacksynth)
  • --model: Modelo de IA a usar (padrão: openrouter/openai/gpt-oss-120b). Os modelos compatíveis incluem:
    • Modelos Claude: Use o nome exato do modelo na API (ex.: claude-sonnet-4-0, , )

Opções do Solver Externo

O solver external permite que o BoxPwnr delegue a qualquer ferramenta externa (Claude Code, Aider, scripts personalizados, etc.):

  • --external-timeout: Tempo limite para o subprocesso do solver externo em segundos (padrão: 3600)
  • Comando após --: O comando externo a executar (ex.: -- claude -p "$BOXPWNR_PROMPT")

Variáveis de ambiente disponíveis para ferramentas externas:

  • BOXPWNR_PROMPT: Prompt completo do sistema com informações do alvo
  • BOXPWNR_TARGET_IP: Informações de conexão do alvo (IP/hostname)
  • BOXPWNR_CONTAINER: Nome do contêiner Docker (útil para cenários VPN)

Executores

O BoxPwnr suporta diferentes ambientes para executar comandos usando --executor:

  • docker (padrão): Executa comandos dentro de um contêiner Docker Kali Linux isolado que o BoxPwnr cria e gerencia automaticamente. Esta é a opção recomendada para a maioria das plataformas e casos de uso.
  • ssh: Executa comandos em um host remoto via SSH. Útil para configurações de rede personalizadas ou quando executado em sua própria infraestrutura. Requer --ssh-host (e opcionalmente --ssh-username, --ssh-key-path, --ssh-port).
  • platform: Roteia comandos pelo próprio attackbox/terminal da plataforma (WebSocket). Isso é obrigatório ao usar --platform levelupctf.

Opções relacionadas:

  • --keep-container: Mantém o contêiner Docker em execução após a conclusão (acelera tentativas subsequentes).
  • --architecture: Força uma arquitetura específica de contêiner (amd64 é útil em Apple Silicon).
  • --image: Usa uma imagem Docker personalizada em vez da imagem Kali embutida.

Opções Específicas de Plataforma

  • Opções do HTB CTF:
    • --ctf-id: ID do evento CTF (obrigatório ao usar --platform htb_ctf)
  • Opções do CTFd:
    • --ctfd-url: URL da instância CTFd (obrigatório ao usar --platform ctfd)
  • Opções do ExploitBench:
    • --exploitbench-config: Nome da configuração do benchmark (padrão: v8)
    • --exploitbench-success-cap: Capacidade que conta como sucesso (padrão: ace)
    • --exploitbench-seed: Semente do episódio (padrão: 1)

Exemplos```bash

Regular use (container stops after execution)

uv run boxpwnr --platform htb --target meow --debug

Development mode (keeps container running for faster subsequent runs)

uv run boxpwnr --platform htb --target meow --debug --keep-container

Run on AMD64 architecture (useful for x86 compatibility on ARM systems like M1/M2 Macs)

uv run boxpwnr --platform htb --target meow --architecture amd64

Limit the number of turns

uv run boxpwnr --platform htb --target meow --max-turns 10

Limit the maximum cost

uv run boxpwnr --platform htb --target meow --max-cost 1.5

Run with multiple attempts for pass@5 benchmarks

uv run boxpwnr --platform htb --target meow --attempts 5

Use a specific model

uv run boxpwnr --platform htb --target meow --model claude-sonnet-4-0

Use Claude Haiku 4.5 (fast, cost-effective, and intelligent)

uv run boxpwnr --platform htb --target meow --model claude-haiku-4-5-20251001 --max-cost 0.5

Use GPT-5-mini (fast and cost-effective)

uv run boxpwnr --platform htb --target meow --model gpt-5-mini --max-cost 1.0

Use Grok-4 (advanced reasoning model)

uv run boxpwnr --platform htb --target meow --model grok-4 --max-cost 2.0

Use OpenRouter free tier (auto-routing)

uv run boxpwnr --platform htb --target meow --model openrouter/openrouter/free --max-cost 0.5

Use gpt-oss-120b via OpenRouter (open-weight 117B MoE model with reasoning)

uv run boxpwnr --platform htb --target meow --model openrouter/openai/gpt-oss-120b --max-cost 1.0

Use Kimi K2.5 via OpenRouter (Moonshot AI's reasoning model)

uv run boxpwnr --platform htb --target meow --model openrouter/moonshotai/kimi-k2.5 --max-cost 1.0

Use Cline free model (requires: npm install -g cline && cline auth)

uv run boxpwnr --platform htb --target meow --model cline/minimax/minimax-m2.5

Use Z.AI GLM-5 (Zhipu AI reasoning model)

uv run boxpwnr --platform htb --target meow --model z-ai/glm-5 --max-cost 1.0

Use Kilo free model (GLM-5 via Kilo gateway)

uv run boxpwnr --platform htb --target meow --model kilo/z-ai/glm-5

Use Kimi K2.5 directly (requires Kimi Code subscription)

uv run boxpwnr --platform htb --target meow --model kimi/kimi-k2.5 --max-cost 1.0

Use OpenCode free model (no authentication required)

uv run boxpwnr --platform htb --target meow --model opencode/big-pickle --max-cost 0.5

Use Claude Code solver (use CC as agent)

uv run boxpwnr --platform htb --target meow --solver claude_code --model claude-sonnet-4-0 --max-cost 2.0

Use Codex CLI solver (OpenAI Codex Max subscription)

uv run boxpwnr --platform htb --target meow --solver codex --model gpt-5.3-codex --max-time 60

Use Grok CLI solver (xAI subscription auth)

uv run boxpwnr --platform cybench --target "[Very Easy] Dynastic" --solver grok --max-time 60

Use Cursor CLI solver (Cursor Agent / subscription auth, Docker required)

uv run boxpwnr --platform htb --target meow --solver cursor-cli --model composer-2.5 --max-time 60

Use Kiro CLI solver

uv run boxpwnr --platform htb --target meow --solver kiro_cli --max-time 60

Use HackSynth solver (autonomous CTF agent with planner-executor-summarizer architecture)

uv run boxpwnr --platform htb --target meow --solver hacksynth --model gpt-5 --max-cost 1.0

Use single_loop_compactation solver for long-running traces that may exceed context limits

uv run boxpwnr --platform htb --target meow --solver single_loop_compactation --model gpt-5 --max-turns 100

Customize compaction behavior

uv run boxpwnr --platform htb --target meow --solver single_loop_compactation --compaction-threshold 0.70 --preserve-last-turns 15

Use NVIDIA NIM (API key) or nvidia-web playground (no API key)

uv run boxpwnr --platform htb --target meow --model nvidia/moonshotai/kimi-k2.6 --max-cost 1.0 uv run boxpwnr --platform htb --target meow --model nvidia-web/moonshotai/kimi-k2.6 --max-time 60

Generate a new report from existing attempt

uv run boxpwnr --generate-report machines/meow/traces/20250129_180409

Run an HTB challenge (app.hackthebox.com/challenges)

uv run boxpwnr --platform htb_challenges --target "Flag Command"

Run a CTF challenge

uv run boxpwnr --platform htb_ctf --ctf-id 1234 --target "Web Challenge"

Run a CTFd challenge

uv run boxpwnr --platform ctfd --ctfd-url https://ctf.example.com --target "Crypto 101"

Run with custom instructions

uv run boxpwnr --platform htb --target meow --custom-instructions "Focus on privilege escalation techniques and explain your steps in detail"

Generate a progress file for a failed attempt (can be resumed later)

uv run boxpwnr --platform htb --target meow --generate-progress --max-turns 20

Resume from a previous attempt using the generated progress file

uv run boxpwnr --platform htb --target meow --resume-from targets/htb/meow/traces/20250127_120000/progress.md --max-turns 30

Run XBOW benchmark (automatically clones benchmarks on first use)

uv run boxpwnr --platform xbow --target XBEN-060-24 --model gpt-5 --max-turns 30

List all available XBOW benchmarks

uv run boxpwnr --platform xbow --list

Run Cybench challenge (automatically clones repository on first use)

You can use either the short name or full path

uv run boxpwnr --platform cybench --target "[Very Easy] Dynastic" --model gpt-5 --max-cost 2.0

Or with full path:

uv run boxpwnr --platform cybench --target "benchmark/hackthebox/cyber-apocalypse-2024/crypto/[Very Easy] Dynastic" --model gpt-5 --max-cost 2.0

List all available Cybench challenges (40 professional CTF tasks)

uv run boxpwnr --platform cybench --list

Run ExploitBench (MCP grading; Grok works well here)

uv run boxpwnr --platform exploitbench --target sample-stack-bof --solver grok --exploitbench-success-cap ace --max-time 60 uv run boxpwnr --platform exploitbench --list

Run Argus challenge (Dockerized web vuln benchmarks; targets look like APEX-...)

uv run boxpwnr --platform argus --list uv run boxpwnr --platform argus --target APEX-001 --model gpt-5 --max-cost 1.0

Run CyberGym task (PoC that crashes the vulnerable build; IDs look like arvo:10013 or oss-fuzz:42535201)

uv run boxpwnr --platform cybergym --list uv run boxpwnr --platform cybergym --target arvo:10013 --model gpt-5 --max-cost 2.0

Use external solver with Claude Code (note: wrap in bash -c with single quotes)

uv run boxpwnr --platform htb --target meow --solver external -- bash -c 'claude --dangerously-skip-permissions -p "$BOXPWNR_PROMPT"'

Use external solver with OpenAI Codex CLI

uv run boxpwnr --platform htb --target meow --solver external -- bash -c 'codex --yolo "$BOXPWNR_PROMPT"'

Use external solver with custom timeout (2 hours)

uv run boxpwnr --platform htb --target meow --solver external --external-timeout 7200 -- bash -c 'claude --dangerously-skip-permissions -p "$BOXPWNR_PROMPT"'

Use external solver inside Docker container (for VPN scenarios)

When the target requires VPN, run the external tool inside BoxPwnr's Docker container.

IS_SANDBOX=1 allows --dangerously-skip-permissions to work as root.

uv run boxpwnr --platform htb --target meow --solver external --
bash -c 'docker exec -e IS_SANDBOX=1 -e ANTHROPIC_API_KEY="$ANTHROPIC_API_KEY" "$BOXPWNR_CONTAINER" claude --dangerously-skip-permissions -p "$BOXPWNR_PROMPT"'

root@kitploit:~
## Por que HackTheBox?

As máquinas do HackTheBox fornecem um excelente campo de testes de ponta a ponta para avaliar sistemas de IA, pois exigem:

- Capacidades de raciocínio complexas
- Pensamento criativo "fora da caixa"
- Compreensão de vários conceitos de segurança
- Capacidade de encadear várias etapas
- Habilidades dinâmicas de resolução de problemas

## Por que agora? *(escrito em 26 de janeiro de 2025)*

Com os avanços recentes da tecnologia de LLMs:

- Os modelos estão se tornando cada vez mais sofisticados em suas capacidades de raciocínio
- O custo de executar esses modelos está diminuindo (veja o DeepSeek R1 Zero)
- Sua capacidade de entender e gerar código está melhorando
- Eles estão ficando melhores em manter contexto e resolver problemas de múltiplas etapas

Acredito que, nos próximos anos, os LLMs terão a capacidade de resolver a maioria das máquinas de HTB de forma autônoma, marcando um avanço significativo nas capacidades de teste de segurança de IA e resolução de problemas.

## Desenvolvimento

### Testes

O BoxPwnr suporta a execução de workflows do GitHub Actions localmente usando `[act](https://github.com/nektos/act)`, que simula o ambiente exato de CI antes de enviar para o GitHub:```bash
# Install act (macOS)
brew install act

# Run CI workflows locally
make ci-test           # Run main test workflow
make ci-integration    # Run integration tests (slow - downloads Python each time)
make ci-docker         # Run docker build test
make ci-all            # Run all workflows

Aviso Legal

Este projeto é apenas para fins de pesquisa e educação. Sempre siga os termos de serviço e as diretrizes éticas de cada plataforma ao usar esta ferramenta.

Baixar ferramenta
PlataformaResolvidosConclusãoTraces
HTB Starting Point25/25100.0%770
HTB Labs268/52651.0%783
HTB Challenges324/81839.6%732
PortSwigger Labs163/27060.4%377
XBOW102/10498.1%525
Cybench40/40100.0%2165
CyberGym476/150731.6%977
picoCTF502/50399.8%1215
TryHackMe213/47744.8%905
HackBench11/1668.8%27
ExploitBench2/424.8%58
LevelUpCTF50/25419.7%146
Argus47/6078.3%1026
BSidesSF CTF 202643/5184.3%76
Cloud Village CTF 202612/2060.0%30
Neurogrid CTF: The ultimate AI security showdown17/3647.2%197
  • --target: Nome do alvo (ex.: meow para máquina HTB, "SQL injection UNION attack" para laboratório PortSwigger, ou XBEN-060-24 para benchmark XBOW)
  • --debug: Ativa registro detalhado (mostra nomes e descrições das ferramentas)
  • --debug-langchain: Ativa o modo de depuração do LangChain (mostra requisições HTTP completas com esquemas de ferramentas, rastreamentos do LangChain e payloads brutos da API - muito detalhado)
  • --max-turns: Número máximo de turnos antes de parar (ex.: --max-turns 10)
  • --max-cost: Custo máximo em USD antes de parar (ex.: --max-cost 2.0)
  • --max-time: Tempo máximo em minutos por tentativa (ex.: --max-time 60)
  • --attempts: Número de tentativas para resolver o alvo (ex.: --attempts 5 para benchmarks pass@5)
  • --default-execution-timeout: Tempo limite padrão para execução de comandos em segundos (padrão: 30)
  • --max-execution-timeout: Tempo limite máximo para execução de comandos em segundos (padrão: 300)
  • --custom-instructions: Instruções personalizadas adicionais para anexar ao prompt do sistema
  • claude-opus-4-0
    claude-haiku-4-5-20251001
  • Modelos OpenAI: gpt-5, gpt-5-nano, gpt-5-mini
  • Outros modelos: deepseek-reasoner, grok-4, gemini-3-flash-preview
  • Modelos OpenRouter: openrouter/company/model (ex.: openrouter/openrouter/free, openrouter/openai/gpt-oss-120b, openrouter/x-ai/grok-4-fast, openrouter/moonshotai/kimi-k2.5)
  • NVIDIA NIM: nvidia/company/model (ex.: nvidia/moonshotai/kimi-k2.6) via integrate.api.nvidia.com
  • NVIDIA playground (sem chave de API; Playwright): nvidia-web/company/model (ex.: nvidia-web/moonshotai/kimi-k2.6)
  • Modelos Z.AI: z-ai/model-name (ex.: z-ai/glm-5, z-ai/glm-5.2) para modelos Zhipu AI GLM
  • Modelos gratuitos Kilo: kilo/model-name (ex.: kilo/z-ai/glm-5) via gateway Kilo
  • Modelos Kimi: kimi/model-name (ex.: kimi/kimi-k2.5, kimi/kimi-k2.7) para assinatura Kimi Code
  • Modelos gratuitos Cline: cline/minimax/minimax-m2.5, cline/moonshotai/kimi-k2.5 (requer cline auth, veja abaixo)
  • Ollama Cloud: ollama-cloud/model-name (ex.: ollama-cloud/minimax-m3:cloud)
  • Ollama local: ollama:model-name
  • --reasoning-effort: Nível de esforço de raciocínio para modelos com capacidade de raciocínio (minimal, low, medium, high). Aplica-se apenas a modelos que suportam raciocínio como gpt-5, o4-mini, grok-4. O padrão é medium para modelos de raciocínio.