Skip to content
KitploitKITPLOIT
StrumentiBlog
Log in
Invia
StrumentiBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

FeedContattoPrivacy© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
BoxPwnr — Un framework modulare per il benchmarking di LLM e strategie agentiche su sfide di sicurezza in HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF e altro. | Kitploit
Strumenti/GitHubGitHub/0ca/boxpwnr
Escalation di PrivilegiRicognizioneFramework di ExploitGenerazione di PayloadAnalisi delle VulnerabilitàSicurezza WebCTFPenetration TestingApprendimento e FormazioneSicurezza dell'IALab e Pratica
44355242 mesi faRevisionato da Kitploit

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi
GitHub
0ca/boxpwnr

BoxPwnr

Un framework modulare per il benchmarking di LLM e strategie agentiche su sfide di sicurezza in HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF e altro.

Vedi Repository

BoxPwnr

Un esperimento divertente per vedere fin dove i Large Language Models (LLM) possono arrivare nel risolvere autonomamente sfide CTF e laboratori di sicurezza. È iniziato con HackTheBox e ora copre molte piattaforme e solver agenziali.

BoxPwnr fornisce un sistema plug and play che può essere utilizzato per testare le prestazioni di diverse architetture agenziali: --solver [claude_code, codex, cursor-cli, grok, kiro_cli, external, single_loop_xmltag, single_loop, single_loop_compactation, hacksynth].

Piattaforme supportate: --platform [htb, htb_ctf, htb_challenges, portswigger, ctfd, local, xbow, hackbench, cybergym, exploitbench, picoctf, tryhackme, levelupctf, argus]

Consulta Platform Implementations per la documentazione dettagliata su ogni piattaforma supportata.

Tracce e Benchmark

Tutte le tracce di risoluzione sono disponibili in BoxPwnr Traces & Benchmarks. Ogni traccia include i log completi delle conversazioni che mostrano il ragionamento dell'LLM, i comandi eseguiti e gli output ricevuti. Puoi riprodurre qualsiasi traccia in un visualizzatore web interattivo per vedere esattamente come la macchina è stata risolta passo dopo passo.

🔬 BoxPwnr Traces & Benchmarks

Total Challenges Challenges Solved Total Traces Platforms

PiattaformaRisolteCompletamentoTracce
HTB Starting Point25/25100.0%770
HTB Labs268/52651.0%783
HTB Challenges324/81839.6%732
PortSwigger Labs163/27060.4%377
XBOW102/10498.1%525
Cybench40/40100.0%2165
CyberGym476/150731.6%977
picoCTF502/50399.8%1215
TryHackMe213/47744.8%905
HackBench11/1668.8%27
ExploitBench2/424.8%58
LevelUpCTF50/25419.7%146
Argus47/6078.3%1026
BSidesSF CTF 202643/5184.3%76
Cloud Village CTF 202612/2060.0%30
Neurogrid CTF: The ultimate AI security showdown17/3647.2%197

Come Funziona

BoxPwnr utilizza LLM (o agenti CLI come Claude Code, Codex, Grok o Cursor) per risolvere autonomamente obiettivi CTF/lab attraverso un processo iterativo:

  1. Ambiente: di default, i comandi vengono eseguiti in un container Docker con Kali Linux (--executor docker)
  • Il container viene creato automaticamente al primo avvio (richiede ~10 minuti)
  • La connessione VPN viene stabilita automaticamente quando la piattaforma lo richiede
  1. Ciclo di esecuzione (solver single_loop_* di default):
  • L'LLM riceve un system prompt dettagliato che definisce il suo compito e i vincoli
  • L'LLM suggerisce il comando successivo in base agli output precedenti
  • Il comando viene eseguito nell'executor scelto
  • L'output viene restituito all'LLM per l'analisi
  • Il processo si ripete finché non viene trovata la flag (o soddisfatti i criteri di successo della piattaforma)
  • I solver basati su CLI (claude_code, codex, grok, cursor-cli, kiro_cli) eseguono il proprio ciclo agente e trasmettono i risultati a BoxPwnr
  1. Automazione dei comandi:
  • Agli agenti viene indicato di fornire comandi completamente automatizzati senza interazione manuale
  • I comandi dovrebbero includere timeout adeguati e gestire i ritardi del servizio
  1. Risultati:
  • La conversazione e i comandi vengono salvati come tracce per analisi/riproduzione
  • Può essere generato un riepilogo quando viene trovata una flag
  • Vengono registrate le statistiche di utilizzo (token, costi, turni)

Utilizzo

Prerequisiti

  1. Clona il repository con i sottomoduli ```bash git clone --recurse-submodules https://github.com/0ca/BoxPwnr cd BoxPwnr

    Install uv if you haven't already

    curl -LsSf https://astral.sh/uv/install.sh | sh

    Sync dependencies (creates .venv)

    uv sync

2. Docker
- BoxPwnr richiede che Docker sia installato e in esecuzione
- Le istruzioni di installazione sono disponibili all'indirizzo: [https://docs.docker.com/get-docker/](https://docs.docker.com/get-docker/)

### Eseguire BoxPwnr```bash
uv run boxpwnr --platform htb --target meow [options]

Al primo avvio, ti verranno richieste le chiavi API necessarie. Le chiavi vengono salvate in .env per un uso futuro. I solver CLI (Claude Code, Codex, Grok, Cursor, Kiro) usano la propria autenticazione tramite abbonamento invece delle chiavi API (o in aggiunta a esse).

Opzioni della riga di comando

Opzioni principali

Scarica lo strumento